ExtractStructuredPage
Text, extraction, structured data
Deskripsi
Merender satu halaman menjadi model teks terstruktur dan menserialisasinya sebagai JSON, XHTML, atau CSV
Model mengelompokkan teks menjadi paragraf dan tabel yang terdeteksi, dengan baris dan span bergaya di bawah paragraf serta baris, cell, dan span di bawah tabel
Sintaks
Delphi
Function TPDFlib.ExtractStructuredPage(Page, Format,
Options: Integer): WideString;ActiveX
Function PDFlib::ExtractStructuredPage(Page As Long, Format As Long,
Options As Long) As StringDLL
const wchar_t* DLExtractStructuredPage(int InstanceID, int Page,
int Format, int Options);
const char* DLExtractStructuredPageA(int InstanceID, int Page,
int Format, int Options);Parameter
| Page | Nomor halaman (mulai dari 1) |
|---|---|
| Format | PDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1), atau PDF_STRUCTURED_TEXT_CSV (2) |
| Options | Nol atau PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) untuk menyertakan font, ukuran, warna, dan perataan vertikal di JSON dan XHTML |
JSON hierarchy
{
"version": 1,
"page": 1,
"width": 612,
"height": 792,
"blocks": [
{"type": "paragraph", "bbox": [40, 50, 300, 70],
"lines": [{"bbox": [40, 50, 300, 70], "spans": []}]},
{"type": "table", "columns": 3, "rows": [[]]}
]
}Nilai yang dikembalikan
JSON and XHTML return complete standalone documents
CSV hanya mengembalikan tabel yang terdeteksi dan kosong saat halaman tidak punya tabel Request tidak valid atau kegagalan ekstraksi mengembalikan string kosong
Catatan
Teks dirender sekali, lalu setiap format dihasilkan dari hierarki intermediate yang sama Deteksi tabel menggabungkan jeda kata normal di dalam cell dan mensyaratkan baris multi-cell yang sejajar, sehingga false positive paragraf berkurang
Bounding box memakai koordinat halaman kiri-atas dan dinyatakan dalam point PDF Pointer kembalian DLL tetap valid sampai pemanggilan berikutnya yang mengembalikan string pada instance yang sama
LastErrorCode bernilai 111 untuk halaman, format, atau opsi tidak valid dan 515 saat ekstraksi gagal
Lihat juga
ExtractStructuredDocument, ExtractPageTextBlocks, GetPageText