ExtractStructuredPage
besedilo, izluščevanje, strukturirani podatki
Opis
Eno stran upodobi v strukturiran besedilni model in jo serializira kot JSON, XHTML ali CSV
Model besedilo združi v odstavke in zaznane tabele, pod odstavki pa vrstice in oblikovane teke, pod tabelami pa vrstice, celice in teke
Sintaksa
Delphi
Function TPDFlib.ExtractStructuredPage(Page, Format,
Options: Integer): WideString;ActiveX
Function PDFlib::ExtractStructuredPage(Page As Long, Format As Long,
Options As Long) As StringDLL
const wchar_t* DLExtractStructuredPage(int InstanceID, int Page,
int Format, int Options);
const char* DLExtractStructuredPageA(int InstanceID, int Page,
int Format, int Options);Parametri
| Page | Številka strani, šteto od 1 |
|---|---|
| Format | PDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) ali PDF_STRUCTURED_TEXT_CSV (2) |
| Options | Nič ali PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) za vključitev pisave, velikosti, barve in navpične poravnave v JSON in XHTML |
Hierarhija JSON
{
"version": 1,
"page": 1,
"width": 612,
"height": 792,
"blocks": [
{"type": "paragraph", "bbox": [40, 50, 300, 70],
"lines": [{"bbox": [40, 50, 300, 70], "spans": []}]},
{"type": "table", "columns": 3, "rows": [[]]}
]
}Vrnjene vrednosti
JSON in XHTML vrneta popolna samostojna dokumenta
CSV vrne samo zaznane tabele in je prazen, kadar stran nima tabeleNeveljavna zahteva ali spodletela izvleka vrne prazen niz
Opombe
Besedilo je izrisano enkrat, nato pa se vsak format ustvari iz iste vmesne hierarhijeZaznavanje tabel združi običajne vrzeli med besedami znotraj celice in zahteva poravnane vrstice z več celicami, kar zmanjša lažne pozitive odstavkov
Omejevalni okvirji uporabljajo koordinate strani z zgornjim levim kotom in so izraženi v točkah PDFKazalci vračanih nizov DLL ostanejo veljavni do naslednjega klica na isti instanci
LastErrorCode je 111 za neveljavno stran, format ali možnosti in 515, kadar izluščevanje spodleti
Glejte tudi
ExtractStructuredDocument, ExtractPageTextBlocks, GetPageText