ExtractStructuredDocument

Text, extraction, structured data

Opis

Extracts a page range into one JSON document, one XHTML document, or a sequence of detected CSV tables

Sintaksa

Delphi

Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
  Format, Options: Integer): WideString;

ActiveX

Function PDFlib::ExtractStructuredDocument(PageRange As String,
  Format As Long, Options As Long) As String

DLL

const wchar_t* DLExtractStructuredDocument(int InstanceID,
  const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
  const char* PageRange, int Format, int Options);

Parametri

PageRangeRaspon stranica u 1-baziranom brojanju poput 1-3,7, ili prazan niz znakova za svaku stranicu
FormatPDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) ili PDF_STRUCTURED_TEXT_CSV (2)
OptionsZero or PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1)

Povratne vrijednosti

JSON contains a versioned pages array and XHTML contains one semantic section per selected page

CSV contains only detected tables and is empty when no selected page has one

An invalid range, format, or option and any extraction failure return an empty string

Napomene

Tijekom sastavljanja izlaza zadržava se samo tekstualni model trenutačne stranice, pa memorija izdvajanja za geometriju i hijerarhiju prati najkompleksniju odabranu stranicu umjesto broja stranica dokumenta

Odabrana stranica vraća se u prethodno stanje prije završetka poziva

Napredak i suradničko otkazivanje upotrebljavaju normalan životni ciklus operacije nad dokumentom

LastErrorCode is 111 for invalid input and 515 when extraction fails

Vidi također

ExtractStructuredPage, ExtractPageRangeText