ExtractStructuredPage

Text, extraction, structured data

Kuvaus

Renderöi yhden sivun jäsennellyksi tekstimalliksi ja sarjallistaa sen JSONina, XHTMLinä tai CSV:nä

Malli ryhmittelee tekstin kappaleiksi ja havaituiksi taulukoiksi, riveillä ja tyylitellyillä palstoilla kappaleiden alla sekä riveillä, soluilla ja palstoilla taulukoiden alla

Syntaksi

Delphi

Function TPDFlib.ExtractStructuredPage(Page, Format,
  Options: Integer): WideString;

ActiveX

Function PDFlib::ExtractStructuredPage(Page As Long, Format As Long,
  Options As Long) As String

DLL

const wchar_t* DLExtractStructuredPage(int InstanceID, int Page,
  int Format, int Options);
const char* DLExtractStructuredPageA(int InstanceID, int Page,
  int Format, int Options);

Parametrit

PageYhdestä alkava sivunumero
FormatPDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) tai PDF_STRUCTURED_TEXT_CSV (2)
OptionsZero or PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) to include font, size, colour, and vertical alignment in JSON and XHTML

JSON hierarchy

{
  "version": 1,
  "page": 1,
  "width": 612,
  "height": 792,
  "blocks": [
    {"type": "paragraph", "bbox": [40, 50, 300, 70],
     "lines": [{"bbox": [40, 50, 300, 70], "spans": []}]},
    {"type": "table", "columns": 3, "rows": [[]]}
  ]
}

Paluuarvot

JSON ja XHTML palauttavat täydelliset itseriittoiset asiakirjat

CSV palauttaa vain havaitut taulukot ja on tyhjä, kun sivulla ei ole taulukkoaVirheellinen pyyntö tai poimintavirhe palauttaa tyhjän merkkijonon

Remarks

Teksti renderöidään kerran, ja jokainen muoto tuotetaan samasta välivaiheen hierarkiastaTaulukoiden tunnistus yhdistää solun sisäiset tavalliset sanavälit ja vaatii linjattuja monisolurivejä, mikä vähentää kappaleiden vääriä osumia

Rajaus­laatikot käyttävät ylävasemmalla olevia sivukoordinaatteja ja esitetään PDF-pisteinäDLL:n palautusosoittimet pysyvät kelvollisina seuraavaan saman instanssin merkkijonon palauttavaan kutsuun asti

LastErrorCode is 111 for invalid page, format, or options and 515 when extraction fails

Katso myös

ExtractStructuredDocument, ExtractPageTextBlocks, GetPageText