ExtractStructuredPage

besedilo, izluščevanje, strukturirani podatki

Opis

Eno stran upodobi v strukturiran besedilni model in jo serializira kot JSON, XHTML ali CSV

Model besedilo združi v odstavke in zaznane tabele, pod odstavki pa vrstice in oblikovane teke, pod tabelami pa vrstice, celice in teke

Sintaksa

Delphi

Function TPDFlib.ExtractStructuredPage(Page, Format,
  Options: Integer): WideString;

ActiveX

Function PDFlib::ExtractStructuredPage(Page As Long, Format As Long,
  Options As Long) As String

DLL

const wchar_t* DLExtractStructuredPage(int InstanceID, int Page,
  int Format, int Options);
const char* DLExtractStructuredPageA(int InstanceID, int Page,
  int Format, int Options);

Parametri

PageŠtevilka strani, šteto od 1
FormatPDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) ali PDF_STRUCTURED_TEXT_CSV (2)
OptionsNič ali PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) za vključitev pisave, velikosti, barve in navpične poravnave v JSON in XHTML

Hierarhija JSON

{
  "version": 1,
  "page": 1,
  "width": 612,
  "height": 792,
  "blocks": [
    {"type": "paragraph", "bbox": [40, 50, 300, 70],
     "lines": [{"bbox": [40, 50, 300, 70], "spans": []}]},
    {"type": "table", "columns": 3, "rows": [[]]}
  ]
}

Vrnjene vrednosti

JSON in XHTML vrneta popolna samostojna dokumenta

CSV vrne samo zaznane tabele in je prazen, kadar stran nima tabeleNeveljavna zahteva ali spodletela izvleka vrne prazen niz

Opombe

Besedilo je izrisano enkrat, nato pa se vsak format ustvari iz iste vmesne hierarhijeZaznavanje tabel združi običajne vrzeli med besedami znotraj celice in zahteva poravnane vrstice z več celicami, kar zmanjša lažne pozitive odstavkov

Omejevalni okvirji uporabljajo koordinate strani z zgornjim levim kotom in so izraženi v točkah PDFKazalci vračanih nizov DLL ostanejo veljavni do naslednjega klica na isti instanci

LastErrorCode je 111 za neveljavno stran, format ali možnosti in 515, kadar izluščevanje spodleti

Glejte tudi

ExtractStructuredDocument, ExtractPageTextBlocks, GetPageText