ExtractStructuredDocument

Văn bản, trích xuất, dữ liệu có cấu trúc

Mô tả

Trích một dải trang thành một tài liệu JSON, một tài liệu XHTML hay một chuỗi các bảng CSV được phát hiện

Cú pháp

Delphi

Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
  Format, Options: Integer): WideString;

ActiveX

Function PDFlib::ExtractStructuredDocument(PageRange As String,
  Format As Long, Options As Long) As String

DLL

const wchar_t* DLExtractStructuredDocument(int InstanceID,
  const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
  const char* PageRange, int Format, int Options);

Tham số

PageRangeDải trang tính từ 1 như 1-3,7, hoặc chuỗi rỗng cho mọi trang
FormatPDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1), or PDF_STRUCTURED_TEXT_CSV (2)
OptionsZero or PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1)

Giá trị trả về

JSON chứa một mảng pages có phiên bản còn XHTML chứa một section ngữ nghĩa cho mỗi trang đã chọnCSV chỉ chứa các bảng được phát hiện và rỗng khi không trang nào được chọn có bảng

Dải, định dạng hay tùy chọn không hợp lệ và mọi lỗi trích xuất đều trả về chuỗi rỗng

Vùng, định dạng hoặc tùy chọn không hợp lệ cùng mọi thất bại khi trích xuất đều trả chuỗi rỗng

Ghi chú

Trong lúc dựng đầu ra, chỉ mô hình văn bản của trang hiện tại được giữ lại, nên memory trích xuất cho hình học và phân cấp bám theo trang đang chọn phức tạp nhất chứ không phải số trang của tài liệu

Trang đang chọn được khôi phục trước khi hàm trả về

Trang đang chọn được khôi phục trước khi hàm trả vềTiến trình và hủy hợp tác dùng vòng đời thao tác tài liệu bình thường

LastErrorCode bằng 111 cho đầu vào không hợp lệ và 515 khi trích xuất thất bại

Xem thêm

ExtractStructuredPage, ExtractPageRangeText