ExtractStructuredDocument

Text, extraction, structured data

Deskripsi

Mengekstrak rentang halaman menjadi satu dokumen JSON, satu dokumen XHTML, atau rangkaian tabel CSV yang terdeteksi

Sintaks

Delphi

Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
  Format, Options: Integer): WideString;

ActiveX

Function PDFlib::ExtractStructuredDocument(PageRange As String,
  Format As Long, Options As Long) As String

DLL

const wchar_t* DLExtractStructuredDocument(int InstanceID,
  const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
  const char* PageRange, int Format, int Options);

Parameter

PageRangeRentang halaman (mulai dari 1) seperti 1-3,7, atau string kosong untuk setiap halaman
FormatPDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1), atau PDF_STRUCTURED_TEXT_CSV (2)
OptionsZero or PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1)

Nilai kembalian

JSON memuat array pages berversi dan XHTML memuat satu section semantik per halaman terpilih CSV hanya berisi tabel yang terdeteksi dan kosong saat tidak ada halaman terpilih yang punya tabel

Rentang, format, atau opsi tidak valid serta kegagalan ekstraksi apa pun mengembalikan string kosong

Catatan

Hanya model teks halaman saat ini yang dipertahankan selama output dirakit, sehingga memori ekstraksi untuk geometri dan hierarki mengikuti halaman terpilih yang paling kompleks, bukan jumlah halaman dokumen

Halaman terpilih dipulihkan sebelum panggilan kembali Progres dan pembatalan kooperatif memakai siklus operasi dokumen yang normal

LastErrorCode bernilai 111 untuk input tidak valid dan 515 saat ekstraksi gagal

Lihat juga

ExtractStructuredPage, ExtractPageRangeText