ExtractStructuredDocument

Text, extrakce, strukturovaná data

Popis

Extrahuje rozsah stránek do jednoho dokumentu JSON, jednoho dokumentu XHTML nebo sekvence zjištěných tabulek CSV

Syntaxe

Delphi

Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
  Format, Options: Integer): WideString;

ActiveX

Function PDFlib::ExtractStructuredDocument(PageRange As String,
  Format As Long, Options As Long) As String

DLL

const wchar_t* DLExtractStructuredDocument(int InstanceID,
  const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
  const char* PageRange, int Format, int Options);

Parametry

PageRangeRozsah stránek od jedničky, například 1-3,7, nebo prázdný řetězec pro všechny stránky
FormatPDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) nebo PDF_STRUCTURED_TEXT_CSV (2)
OptionsNula nebo PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1)

Návratové hodnoty

JSON obsahuje verzované pole pages a XHTML obsahuje jednu sémantickou section na každý vybranou stránku

CSV obsahuje jen zjištěné tabulky a je prázdné, když žádná vybraná stránka žádnou nemá

Neplatný rozsah, formát nebo volba a jakékoliv selhání extrakce vrací prázdný řetězec

Poznámky

Během sestavování výstupu se uchovává jen textový model aktuální stránky, takže extrakční paměť pro geometrii a hierarchii sleduje nejsložitější vybranou stránku, nikoli počet stránek dokumentu

Vybraná stránka se obnoví před tím, než volání skončí

Průběh a kooperativní zrušení používají normální životní cyklus operací nad dokumentem

LastErrorCode je 111 pro neplatný vstup a 515, když selže extrakce

Viz také

ExtractStructuredPage, ExtractPageRangeText