ExtractStructuredDocument
Văn bản, trích xuất, dữ liệu có cấu trúc
Mô tả
Trích một dải trang thành một tài liệu JSON, một tài liệu XHTML hay một chuỗi các bảng CSV được phát hiện
Cú pháp
Delphi
Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
Format, Options: Integer): WideString;ActiveX
Function PDFlib::ExtractStructuredDocument(PageRange As String,
Format As Long, Options As Long) As StringDLL
const wchar_t* DLExtractStructuredDocument(int InstanceID,
const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
const char* PageRange, int Format, int Options);Tham số
| PageRange | Dải trang tính từ 1 như 1-3,7, hoặc chuỗi rỗng cho mọi trang |
|---|---|
| Format | PDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1), or PDF_STRUCTURED_TEXT_CSV (2) |
| Options | Zero or PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) |
Giá trị trả về
JSON chứa một mảng pages có phiên bản còn XHTML chứa một section ngữ nghĩa cho mỗi trang đã chọnCSV chỉ chứa các bảng được phát hiện và rỗng khi không trang nào được chọn có bảng
Dải, định dạng hay tùy chọn không hợp lệ và mọi lỗi trích xuất đều trả về chuỗi rỗng
Vùng, định dạng hoặc tùy chọn không hợp lệ cùng mọi thất bại khi trích xuất đều trả chuỗi rỗng
Ghi chú
Trong lúc dựng đầu ra, chỉ mô hình văn bản của trang hiện tại được giữ lại, nên memory trích xuất cho hình học và phân cấp bám theo trang đang chọn phức tạp nhất chứ không phải số trang của tài liệu
Trang đang chọn được khôi phục trước khi hàm trả về
Trang đang chọn được khôi phục trước khi hàm trả vềTiến trình và hủy hợp tác dùng vòng đời thao tác tài liệu bình thường
LastErrorCode bằng 111 cho đầu vào không hợp lệ và 515 khi trích xuất thất bại