ExtractStructuredPage
Tekst, udtræk, strukturerede data
Beskrivelse
Gengiver én side til en struktureret tekstmodel og serialiserer den som JSON, XHTML eller CSV
Modellen grupperer tekst i afsnit og registrerede tabeller med linjer og typograferede tekststykker under afsnit og rækker, celler og tekststykker under tabeller
Syntaks
Delphi
Function TPDFlib.ExtractStructuredPage(Page, Format,
Options: Integer): WideString;ActiveX
Function PDFlib::ExtractStructuredPage(Page As Long, Format As Long,
Options As Long) As StringDLL
const wchar_t* DLExtractStructuredPage(int InstanceID, int Page,
int Format, int Options);
const char* DLExtractStructuredPageA(int InstanceID, int Page,
int Format, int Options);Parametre
| Page | Det 1-baserede sidenummer |
|---|---|
| Format | PDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) eller PDF_STRUCTURED_TEXT_CSV (2) |
| Options | Nul eller PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) for at medtage skrifttype, størrelse, farve og lodret justering i JSON og XHTML |
JSON-hierarki
{
"version": 1,
"page": 1,
"width": 612,
"height": 792,
"blocks": [
{"type": "paragraph", "bbox": [40, 50, 300, 70],
"lines": [{"bbox": [40, 50, 300, 70], "spans": []}]},
{"type": "table", "columns": 3, "rows": [[]]}
]
}Returværdier
JSON og XHTML returnerer komplette selvstændige dokumenter
CSV returnerer kun registrerede tabeller og er tom, når siden ikke indeholder nogen tabel
En ugyldig anmodning eller udtræksfejl returnerer en tom streng
Bemærkninger
Teksten gengives én gang, og derefter fremstilles hvert format ud fra det samme mellemliggende hierarki
Tabelregistrering fletter normale mellemrum mellem ord i en celle og kræver justerede rækker med flere celler, hvilket reducerer falske positive resultater for afsnit
Afgrænsningsrammer bruger sidekoordinater med øverste venstre hjørne som udgangspunkt og udtrykkes i PDF-punkter
DLL-returmarkører forbliver gyldige indtil det næste strengreturnerende kald på samme instans
LastErrorCode er 111 ved ugyldig side, format eller indstillinger og 515, når udtrækningen mislykkes
Se også
ExtractStructuredDocument, ExtractPageTextBlocks, GetPageText