ExtractStructuredDocument
分类:文本、提取、结构化数据
描述
将页面范围提取为一个 JSON 文档、一个 XHTML 文档或一系列检测到的 CSV 表格
语法
Delphi
Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
Format, Options: Integer): WideString;ActiveX
Function PDFlib::ExtractStructuredDocument(PageRange As String,
Format As Long, Options As Long) As StringDLL
const wchar_t* DLExtractStructuredDocument(int InstanceID,
const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
const char* PageRange, int Format, int Options);参数
| PageRange | 从 1 开始的页面范围,例如 1-3,7;空字符串表示每一页 |
|---|---|
| Format | PDF_STRUCTURED_TEXT_JSON (0)、PDF_STRUCTURED_TEXT_XHTML (1) 或 PDF_STRUCTURED_TEXT_CSV (2) |
| Options | 零或 PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) |
返回值
JSON 包含带版本的 pages 数组,XHTML 则为每个选定页面包含一个语义 section
CSV 仅包含检测到的表,未选择页面包含表时为空
无效范围、格式或选项以及任何提取失败都会返回空字符串
备注
组装输出时仅保留当前页面的文本模型,因此用于几何和层级的提取内存取决于所选页面中最复杂的页面,而非文档页数
调用返回前会恢复所选页面
进度和协作式取消使用常规文档操作生命周期
无效输入时 LastErrorCode 为 111,提取失败时为 515