ExtractStructuredPage
Tekst, uttrekk, strukturerte data
Beskrivelse
Renderer én side til en strukturert tekstmodell og serialiserer den som JSON, XHTML eller CSV
Modellen grupperer tekst i avsnitt og oppdagede tabeller, med linjer og stylede spans under avsnitt og rader, celler og spans under tabeller
Syntaks
Delphi
Function TPDFlib.ExtractStructuredPage(Page, Format,
Options: Integer): WideString;ActiveX
Function PDFlib::ExtractStructuredPage(Page As Long, Format As Long,
Options As Long) As StringDLL
const wchar_t* DLExtractStructuredPage(int InstanceID, int Page,
int Format, int Options);
const char* DLExtractStructuredPageA(int InstanceID, int Page,
int Format, int Options);Parametere
| Page | Sidenummeret (fra 1) |
|---|---|
| Format | PDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) eller PDF_STRUCTURED_TEXT_CSV (2) |
| Options | Null eller PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) for å inkludere skrift, størrelse, farge og vertikal justering i JSON og XHTML |
JSON-hierarki
{
"version": 1,
"page": 1,
"width": 612,
"height": 792,
"blocks": [
{"type": "paragraph", "bbox": [40, 50, 300, 70],
"lines": [{"bbox": [40, 50, 300, 70], "spans": []}]},
{"type": "table", "columns": 3, "rows": [[]]}
]
}Returverdier
JSON og XHTML returnerer komplette selvstendige dokumenter
CSV returnerer kun oppdagede tabeller og er tom når siden ikke har noen tabell
En ugyldig forespørsel eller uttrekksfeil returnerer en tom streng
Merknader
Tekst renderes én gang, og deretter produseres hvert format fra samme mellomliggende hierarki
Tabelloppdagelse slår sammen normale ordmellomrom inne i en celle og krever justerte flercelle-rader, noe som reduserer falske positiver for avsnitt
Avgrensningsbokser bruker øvre-venstre sidekoordinater og angis i PDF-punkter
DLL-returpekere forblir gyldige til neste kall som returnerer streng på samme instans
LastErrorCode er 111 for ugyldig side, format eller alternativer og 515 når uttrekk feiler
Se også
ExtractStructuredDocument, ExtractPageTextBlocks, GetPageText