ExtractStructuredPage

Text, extraction, structured data

Περιγραφή

Αποδίδει μία σελίδα σε δομημένο μοντέλο κειμένου και το σειριοποιεί ως JSON, XHTML ή CSV

Το μοντέλο ομαδοποιεί κείμενο σε παραγράφους και ανιχνευμένους πίνακες, με γραμμές και διακοσμημένα spans κάτω από παραγράφους και γραμμές, κελιά και spans κάτω από πίνακες

Σύνταξη

Delphi

Function TPDFlib.ExtractStructuredPage(Page, Format,
  Options: Integer): WideString;

ActiveX

Function PDFlib::ExtractStructuredPage(Page As Long, Format As Long,
  Options As Long) As String

DLL

const wchar_t* DLExtractStructuredPage(int InstanceID, int Page,
  int Format, int Options);
const char* DLExtractStructuredPageA(int InstanceID, int Page,
  int Format, int Options);

Παράμετροι

PageΟ αριθμός σελίδας με αρίθμηση από το 1
FormatPDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) ή PDF_STRUCTURED_TEXT_CSV (2)
OptionsZero or PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) to include font, size, colour, and vertical alignment in JSON and XHTML

Ιεραρχία JSON

{
  "version": 1,
  "page": 1,
  "width": 612,
  "height": 792,
  "blocks": [
    {"type": "paragraph", "bbox": [40, 50, 300, 70],
     "lines": [{"bbox": [40, 50, 300, 70], "spans": []}]},
    {"type": "table", "columns": 3, "rows": [[]]}
  ]
}

Τιμές επιστροφής

JSON και XHTML επιστρέφουν πλήρη αυτόνομα έγγραφα

Το CSV επιστρέφει μόνο τους εντοπισμένους πίνακες και είναι κενό όταν η σελίδα δεν έχει πίνακαΆκυρο αίτημα ή αποτυχία εξαγωγής επιστρέφει κενή συμβολοσειρά

Remarks

Το κείμενο αποδίδεται μία φορά, και κάθε μορφή παράγεται από την ίδια ενδιάμεση ιεραρχίαΗ ανίχνευση πινάκων συγχωνεύει κανονικά κενά λέξεων μέσα σε κελί και απαιτεί στοιχισμένες γραμμές πολλαπλών κελιών, μειώνοντας ψευδώς θετικές παραγράφους

Τα bounding boxes χρησιμοποιούν συντεταγμένες σελίδας πάνω αριστερά και εκφράζονται σε PDF pointsΟι δείκτες επιστροφής του DLL παραμένουν έγκυροι μέχρι την επόμενη κλήση που επιστρέφει string στο ίδιο instance

LastErrorCode is 111 for invalid page, format, or options and 515 when extraction fails

Δείτε επίσης

ExtractStructuredDocument, ExtractPageTextBlocks, GetPageText