ExtractStructuredPage

Text, extraction, structured data

Deskripsi

Merender satu halaman menjadi model teks terstruktur dan menserialisasinya sebagai JSON, XHTML, atau CSV

Model mengelompokkan teks menjadi paragraf dan tabel yang terdeteksi, dengan baris dan span bergaya di bawah paragraf serta baris, cell, dan span di bawah tabel

Sintaks

Delphi

Function TPDFlib.ExtractStructuredPage(Page, Format,
  Options: Integer): WideString;

ActiveX

Function PDFlib::ExtractStructuredPage(Page As Long, Format As Long,
  Options As Long) As String

DLL

const wchar_t* DLExtractStructuredPage(int InstanceID, int Page,
  int Format, int Options);
const char* DLExtractStructuredPageA(int InstanceID, int Page,
  int Format, int Options);

Parameter

PageNomor halaman (mulai dari 1)
FormatPDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1), atau PDF_STRUCTURED_TEXT_CSV (2)
OptionsNol atau PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) untuk menyertakan font, ukuran, warna, dan perataan vertikal di JSON dan XHTML

JSON hierarchy

{
  "version": 1,
  "page": 1,
  "width": 612,
  "height": 792,
  "blocks": [
    {"type": "paragraph", "bbox": [40, 50, 300, 70],
     "lines": [{"bbox": [40, 50, 300, 70], "spans": []}]},
    {"type": "table", "columns": 3, "rows": [[]]}
  ]
}

Nilai yang dikembalikan

JSON and XHTML return complete standalone documents

CSV hanya mengembalikan tabel yang terdeteksi dan kosong saat halaman tidak punya tabel Request tidak valid atau kegagalan ekstraksi mengembalikan string kosong

Catatan

Teks dirender sekali, lalu setiap format dihasilkan dari hierarki intermediate yang sama Deteksi tabel menggabungkan jeda kata normal di dalam cell dan mensyaratkan baris multi-cell yang sejajar, sehingga false positive paragraf berkurang

Bounding box memakai koordinat halaman kiri-atas dan dinyatakan dalam point PDF Pointer kembalian DLL tetap valid sampai pemanggilan berikutnya yang mengembalikan string pada instance yang sama

LastErrorCode bernilai 111 untuk halaman, format, atau opsi tidak valid dan 515 saat ekstraksi gagal

Lihat juga

ExtractStructuredDocument, ExtractPageTextBlocks, GetPageText