ExtractStructuredDocument
Text, extraction, structured data
Descriere
Extrage un interval de pagini într-un singur document JSON, într-un singur document XHTML sau într-o secvență de tabele CSV detectate
Sintaxă
Delphi
Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
Format, Options: Integer): WideString;ActiveX
Function PDFlib::ExtractStructuredDocument(PageRange As String,
Format As Long, Options As Long) As StringDLL
const wchar_t* DLExtractStructuredDocument(int InstanceID,
const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
const char* PageRange, int Format, int Options);Parametri
| PageRange | Un interval de pagini cu numerotare de la 1, precum 1-3,7, sau un șir vid pentru toate paginile |
|---|---|
| Format | PDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) sau PDF_STRUCTURED_TEXT_CSV (2) |
| Options | Zero or PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) |
Return values
JSON conține un vector pages cu versiune, iar XHTML conține o secțiune section semantică per pagină selectatăCSV-ul conține doar tabelele detectate și este vid când nicio pagină selectată nu are una
Un interval, format sau opțiune invalidă, și orice eșec de extragere, returnează un șir vid
Observații
Doar modelul de text al paginii curente este reținut cât timp ieșirea este asamblată, astfel încât memoria de extragere pentru geometrie și ierarhie urmează cea mai complexă pagină selectată, nu numărul de pagini al documentului
Pagina selectată este restaurată înainte ca apelul să se termine Progresul și anularea cooperativă folosesc ciclul de viață normal al operațiilor pe document
LastErrorCode este 111 pentru JSON OCR invalid și 515 când extragerea eșuează