ExtractStructuredDocument

Testo, estrazione, dati strutturati

Descrizione

Estrae un intervallo in un documento JSON, XHTML o sequenza di tabelle CSV rilevate

Sintassi

Delphi

Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
  Format, Options: Integer): WideString;

ActiveX

Function PDFlib::ExtractStructuredDocument(PageRange As String,
  Format As Long, Options As Long) As String

DLL

const wchar_t* DLExtractStructuredDocument(int InstanceID,
  const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
  const char* PageRange, int Format, int Options);

Parametri

PageRangeUn intervallo di pagine in base uno come 1-3,7 oppure una stringa vuota per ogni pagina
FormatPDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) o PDF_STRUCTURED_TEXT_CSV (2)
OptionsZero o PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1)

Valori restituiti

JSON contiene un array pages con versione e XHTML contiene una section semantica per ogni pagina selezionata

CSV contiene solo le tabelle rilevate ed è vuoto quando nessuna pagina selezionata ne contiene una

Un intervallo, formato o opzione non valido e qualsiasi errore di estrazione restituiscono una stringa vuota

Note

Durante la composizione dell'output viene mantenuto soltanto il modello di testo della pagina corrente, quindi la memoria di estrazione per geometria e gerarchia dipende dalla pagina selezionata più complessa anziché dal numero di pagine del documento

La pagina selezionata viene ripristinata prima del ritorno della chiamata

Avanzamento e annullamento cooperativo usano il normale ciclo di vita delle operazioni sul documento

LastErrorCode è 111 per input non valido e 515 quando l'estrazione non riesce

Vedere anche

ExtractStructuredPage, ExtractPageRangeText