ExtractStructuredDocument
Text, extraction, structured data
Deskripsi
Mengekstrak rentang halaman menjadi satu dokumen JSON, satu dokumen XHTML, atau rangkaian tabel CSV yang terdeteksi
Sintaks
Delphi
Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
Format, Options: Integer): WideString;ActiveX
Function PDFlib::ExtractStructuredDocument(PageRange As String,
Format As Long, Options As Long) As StringDLL
const wchar_t* DLExtractStructuredDocument(int InstanceID,
const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
const char* PageRange, int Format, int Options);Parameter
| PageRange | Rentang halaman (mulai dari 1) seperti 1-3,7, atau string kosong untuk setiap halaman |
|---|---|
| Format | PDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1), atau PDF_STRUCTURED_TEXT_CSV (2) |
| Options | Zero or PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) |
Nilai kembalian
JSON memuat array pages berversi dan XHTML memuat satu section semantik per halaman terpilih CSV hanya berisi tabel yang terdeteksi dan kosong saat tidak ada halaman terpilih yang punya tabel
Rentang, format, atau opsi tidak valid serta kegagalan ekstraksi apa pun mengembalikan string kosong
Catatan
Hanya model teks halaman saat ini yang dipertahankan selama output dirakit, sehingga memori ekstraksi untuk geometri dan hierarki mengikuti halaman terpilih yang paling kompleks, bukan jumlah halaman dokumen
Halaman terpilih dipulihkan sebelum panggilan kembali Progres dan pembatalan kooperatif memakai siklus operasi dokumen yang normal
LastErrorCode bernilai 111 untuk input tidak valid dan 515 saat ekstraksi gagal