ExtractStructuredPage
Text, extraction, structured data
Περιγραφή
Αποδίδει μία σελίδα σε δομημένο μοντέλο κειμένου και το σειριοποιεί ως JSON, XHTML ή CSV
Το μοντέλο ομαδοποιεί κείμενο σε παραγράφους και ανιχνευμένους πίνακες, με γραμμές και διακοσμημένα spans κάτω από παραγράφους και γραμμές, κελιά και spans κάτω από πίνακες
Σύνταξη
Delphi
Function TPDFlib.ExtractStructuredPage(Page, Format,
Options: Integer): WideString;ActiveX
Function PDFlib::ExtractStructuredPage(Page As Long, Format As Long,
Options As Long) As StringDLL
const wchar_t* DLExtractStructuredPage(int InstanceID, int Page,
int Format, int Options);
const char* DLExtractStructuredPageA(int InstanceID, int Page,
int Format, int Options);Παράμετροι
| Page | Ο αριθμός σελίδας με αρίθμηση από το 1 |
|---|---|
| Format | PDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) ή PDF_STRUCTURED_TEXT_CSV (2) |
| Options | Zero or PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) to include font, size, colour, and vertical alignment in JSON and XHTML |
Ιεραρχία JSON
{
"version": 1,
"page": 1,
"width": 612,
"height": 792,
"blocks": [
{"type": "paragraph", "bbox": [40, 50, 300, 70],
"lines": [{"bbox": [40, 50, 300, 70], "spans": []}]},
{"type": "table", "columns": 3, "rows": [[]]}
]
}Τιμές επιστροφής
JSON και XHTML επιστρέφουν πλήρη αυτόνομα έγγραφα
Το CSV επιστρέφει μόνο τους εντοπισμένους πίνακες και είναι κενό όταν η σελίδα δεν έχει πίνακαΆκυρο αίτημα ή αποτυχία εξαγωγής επιστρέφει κενή συμβολοσειρά
Remarks
Το κείμενο αποδίδεται μία φορά, και κάθε μορφή παράγεται από την ίδια ενδιάμεση ιεραρχίαΗ ανίχνευση πινάκων συγχωνεύει κανονικά κενά λέξεων μέσα σε κελί και απαιτεί στοιχισμένες γραμμές πολλαπλών κελιών, μειώνοντας ψευδώς θετικές παραγράφους
Τα bounding boxes χρησιμοποιούν συντεταγμένες σελίδας πάνω αριστερά και εκφράζονται σε PDF pointsΟι δείκτες επιστροφής του DLL παραμένουν έγκυροι μέχρι την επόμενη κλήση που επιστρέφει string στο ίδιο instance
LastErrorCode is 111 for invalid page, format, or options and 515 when extraction fails
Δείτε επίσης
ExtractStructuredDocument, ExtractPageTextBlocks, GetPageText