ExtractStructuredDocument

Text, extraction, structured data

Aprašymas

Ištraukia puslapių diapazoną į vieną JSON dokumentą, vieną XHTML dokumentą arba aptiktųjų CSV lentelių seką

Sintaksė

Delphi

Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
  Format, Options: Integer): WideString;

ActiveX

Function PDFlib::ExtractStructuredDocument(PageRange As String,
  Format As Long, Options As Long) As String

DLL

const wchar_t* DLExtractStructuredDocument(int InstanceID,
  const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
  const char* PageRange, int Format, int Options);

Parametrai

PageRangePuslapių diapazonas nuo 1, toks kaip 1-3,7, arba tuščioji eilutė kiekvienam puslapiui
FormatPDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) arba PDF_STRUCTURED_TEXT_CSV (2)
OptionsNulis arba PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1)

Grąžinamos reikšmės

JSON turi versijuotąjį pages masyvą, o XHTML – po vieną semantinę section skiltį kiekvienam pasirinktajam puslapiui. CSV turi tik aptiktąsias lenteles ir būna tuščias, kai nė vienas pasirinktasis puslapis jų neturi

Netinkamasis diapazonas, formatas arba parinktis ir bet kuri ištraukimo nesėkmė grąžina tuščią eilutę

Pastabos

Kol išvestis renkama, išsaugomas tik esamojo puslapio teksto modelis, todėl geometrijos ir hierarchijos ištraukimo atmintis seka sudėtingiausiu pasirinktuoju puslapiu, o ne dokumento puslapių skaičiumi

Pasirinktasis puslapis atkuriamas dar prieš kvietimui grįžtant. Eiga ir kooperatyvinis atšaukimas naudoja įprastąjį dokumento operacijos gyvavimo ciklą

LastErrorCode yra 111 netinkamai įvesčiai ir 515, kai ištraukimas nepavyksta

Taip pat žr.

ExtractStructuredPage, ExtractPageRangeText