ExtractStructuredDocument
Text, extrakce, strukturovaná data
Popis
Extrahuje rozsah stránek do jednoho dokumentu JSON, jednoho dokumentu XHTML nebo sekvence zjištěných tabulek CSV
Syntaxe
Delphi
Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
Format, Options: Integer): WideString;ActiveX
Function PDFlib::ExtractStructuredDocument(PageRange As String,
Format As Long, Options As Long) As StringDLL
const wchar_t* DLExtractStructuredDocument(int InstanceID,
const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
const char* PageRange, int Format, int Options);Parametry
| PageRange | Rozsah stránek od jedničky, například 1-3,7, nebo prázdný řetězec pro všechny stránky |
|---|---|
| Format | PDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) nebo PDF_STRUCTURED_TEXT_CSV (2) |
| Options | Nula nebo PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) |
Návratové hodnoty
JSON obsahuje verzované pole pages a XHTML obsahuje jednu sémantickou section na každý vybranou stránku
CSV obsahuje jen zjištěné tabulky a je prázdné, když žádná vybraná stránka žádnou nemá
Neplatný rozsah, formát nebo volba a jakékoliv selhání extrakce vrací prázdný řetězec
Poznámky
Během sestavování výstupu se uchovává jen textový model aktuální stránky, takže extrakční paměť pro geometrii a hierarchii sleduje nejsložitější vybranou stránku, nikoli počet stránek dokumentu
Vybraná stránka se obnoví před tím, než volání skončí
Průběh a kooperativní zrušení používají normální životní cyklus operací nad dokumentem
LastErrorCode je 111 pro neplatný vstup a 515, když selže extrakce