ExtractStructuredPage

Text, extraction, structured data

תיאור

Renders one page into a structured text model and serializes it as JSON, XHTML, or CSV

המודל מקבץ טקסט לפסקאות וטבלאות שזוהו, כששורות ו-spanים מעוצבים תחת פסקאות ושורות, תאים ו-spanים תחת טבלאות

תחביר

Delphi

Function TPDFlib.ExtractStructuredPage(Page, Format,
  Options: Integer): WideString;

ActiveX

Function PDFlib::ExtractStructuredPage(Page As Long, Format As Long,
  Options As Long) As String

DLL

const wchar_t* DLExtractStructuredPage(int InstanceID, int Page,
  int Format, int Options);
const char* DLExtractStructuredPageA(int InstanceID, int Page,
  int Format, int Options);

פרמטרים

PageThe one-based page number
FormatPDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) או PDF_STRUCTURED_TEXT_CSV (2)
OptionsZero or PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) to include font, size, colour, and vertical alignment in JSON and XHTML

היררכיית JSON

{
  "version": 1,
  "page": 1,
  "width": 612,
  "height": 792,
  "blocks": [
    {"type": "paragraph", "bbox": [40, 50, 300, 70],
     "lines": [{"bbox": [40, 50, 300, 70], "spans": []}]},
    {"type": "table", "columns": 3, "rows": [[]]}
  ]
}

ערכים מוחזרים

JSON and XHTML return complete standalone documents

‏CSV מחזיר טבלאות שזוהו בלבד והוא ריק כאשר לעמוד אין טבלה; בקשה לא תקפה או כישלון חילוץ מחזירים מחרוזת ריקה

הערות

את הטקסט מעבדים פעם אחת, ואז כל פורמט מיוצר מאותה היררכיה בינייםזיהוי טבלאות ממזג רווחי-מילים רגילים בתוך תא ודורש שורות מרובות-תאים מיושרות, מה שמפחית זיהוי-יתר של פסקאות

תיבות התיחום משתמשות בקואורדינטות עמוד מהפינה השמאלית העליונה ומבוטאות בנקודות PDF; מצביעי ההחזרה של ה-DLL נשארים תקפים עד לקריאה הבאה שמחזירה מחרוזת באותו מופע

LastErrorCode is 111 for invalid page, format, or options and 515 when extraction fails

ראה גם

ExtractStructuredDocument, ExtractPageTextBlocks, GetPageText