ExtractStructuredPage
Text, extraction, structured data
תיאור
Renders one page into a structured text model and serializes it as JSON, XHTML, or CSV
המודל מקבץ טקסט לפסקאות וטבלאות שזוהו, כששורות ו-spanים מעוצבים תחת פסקאות ושורות, תאים ו-spanים תחת טבלאות
תחביר
Delphi
Function TPDFlib.ExtractStructuredPage(Page, Format,
Options: Integer): WideString;ActiveX
Function PDFlib::ExtractStructuredPage(Page As Long, Format As Long,
Options As Long) As StringDLL
const wchar_t* DLExtractStructuredPage(int InstanceID, int Page,
int Format, int Options);
const char* DLExtractStructuredPageA(int InstanceID, int Page,
int Format, int Options);פרמטרים
| Page | The one-based page number |
|---|---|
| Format | PDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) או PDF_STRUCTURED_TEXT_CSV (2) |
| Options | Zero or PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) to include font, size, colour, and vertical alignment in JSON and XHTML |
היררכיית JSON
{
"version": 1,
"page": 1,
"width": 612,
"height": 792,
"blocks": [
{"type": "paragraph", "bbox": [40, 50, 300, 70],
"lines": [{"bbox": [40, 50, 300, 70], "spans": []}]},
{"type": "table", "columns": 3, "rows": [[]]}
]
}ערכים מוחזרים
JSON and XHTML return complete standalone documents
CSV מחזיר טבלאות שזוהו בלבד והוא ריק כאשר לעמוד אין טבלה; בקשה לא תקפה או כישלון חילוץ מחזירים מחרוזת ריקה
הערות
את הטקסט מעבדים פעם אחת, ואז כל פורמט מיוצר מאותה היררכיה בינייםזיהוי טבלאות ממזג רווחי-מילים רגילים בתוך תא ודורש שורות מרובות-תאים מיושרות, מה שמפחית זיהוי-יתר של פסקאות
תיבות התיחום משתמשות בקואורדינטות עמוד מהפינה השמאלית העליונה ומבוטאות בנקודות PDF; מצביעי ההחזרה של ה-DLL נשארים תקפים עד לקריאה הבאה שמחזירה מחרוזת באותו מופע
LastErrorCode is 111 for invalid page, format, or options and 515 when extraction fails
ראה גם
ExtractStructuredDocument, ExtractPageTextBlocks, GetPageText