ExtractStructuredDocument

Text, extraction, structured data

Descriere

Extrage un interval de pagini într-un singur document JSON, într-un singur document XHTML sau într-o secvență de tabele CSV detectate

Sintaxă

Delphi

Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
  Format, Options: Integer): WideString;

ActiveX

Function PDFlib::ExtractStructuredDocument(PageRange As String,
  Format As Long, Options As Long) As String

DLL

const wchar_t* DLExtractStructuredDocument(int InstanceID,
  const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
  const char* PageRange, int Format, int Options);

Parametri

PageRangeUn interval de pagini cu numerotare de la 1, precum 1-3,7, sau un șir vid pentru toate paginile
FormatPDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) sau PDF_STRUCTURED_TEXT_CSV (2)
OptionsZero or PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1)

Return values

JSON conține un vector pages cu versiune, iar XHTML conține o secțiune section semantică per pagină selectatăCSV-ul conține doar tabelele detectate și este vid când nicio pagină selectată nu are una

Un interval, format sau opțiune invalidă, și orice eșec de extragere, returnează un șir vid

Observații

Doar modelul de text al paginii curente este reținut cât timp ieșirea este asamblată, astfel încât memoria de extragere pentru geometrie și ierarhie urmează cea mai complexă pagină selectată, nu numărul de pagini al documentului

Pagina selectată este restaurată înainte ca apelul să se termine Progresul și anularea cooperativă folosesc ciclul de viață normal al operațiilor pe document

LastErrorCode este 111 pentru JSON OCR invalid și 515 când extragerea eșuează

Vedeți și

ExtractStructuredPage, ExtractPageRangeText