ExtractStructuredPage
Text, extraction, structured data
คำอธิบาย
เรนเดอร์หนึ่งหน้าเป็นโมเดลข้อความแบบโครงสร้าง แล้ว serialize เป็น JSON, XHTML หรือ CSV
โมเดลจัดกลุ่มข้อความเป็นย่อหน้ากับตารางที่ตรวจจับได้, มีบรรทัดกับช่วงที่จัดสไตล์อยู่ใต้ย่อหน้า และแถว เซลล์ กับช่วงอยู่ใต้ตาราง
ไวยากรณ์
Delphi
Function TPDFlib.ExtractStructuredPage(Page, Format,
Options: Integer): WideString;ActiveX
Function PDFlib::ExtractStructuredPage(Page As Long, Format As Long,
Options As Long) As StringDLL
const wchar_t* DLExtractStructuredPage(int InstanceID, int Page,
int Format, int Options);
const char* DLExtractStructuredPageA(int InstanceID, int Page,
int Format, int Options);พารามิเตอร์
| Page | หมายเลขหน้าโดยนับจาก 1 |
|---|---|
| Format | PDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1), or PDF_STRUCTURED_TEXT_CSV (2) |
| Options | Zero or PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) to include font, size, colour, and vertical alignment in JSON and XHTML |
JSON hierarchy
{
"version": 1,
"page": 1,
"width": 612,
"height": 792,
"blocks": [
{"type": "paragraph", "bbox": [40, 50, 300, 70],
"lines": [{"bbox": [40, 50, 300, 70], "spans": []}]},
{"type": "table", "columns": 3, "rows": [[]]}
]
}ค่าที่ส่งกลับ
JSON กับ XHTML คืนเอกสารแบบพึ่งพาตัวเองได้ครบชุด
CSV คืนเฉพาะตารางที่ตรวจจับได้ และเป็นสตริงว่างเมื่อหน้าไม่มีตารางคำขอไม่ถูกต้องหรือการสกัดล้มเหลวจะคืนสตริงว่าง
Remarks
ข้อความถูกเรนเดอร์ครั้งเดียว แล้วทุกฟอร์แมตถูกผลิตจากลำดับชั้นกลางชุดเดียวกันการตรวจจับตารางรวมช่องว่างคำปกติภายในเซลล์ และต้องมีแถวหลายเซลล์ที่จัดแนวตรงกัน, ลดการเดาย่อหน้าผิด
กรอบครอบใช้พิกัดหน้าบนซ้ายและแสดงเป็นพอยต์ PDFพอยน์เตอร์ที่ DLL คืนใช้ได้จนกว่าการเรียกคืนค่าสตริงครั้งถัดไปบนอินสแตนซ์เดียวกัน
LastErrorCode is 111 for invalid page, format, or options and 515 when extraction fails
ดูเพิ่มเติม
ExtractStructuredDocument, ExtractPageTextBlocks, GetPageText