ExtractStructuredDocument

分类:文本、提取、结构化数据

描述

将页面范围提取为一个 JSON 文档、一个 XHTML 文档或一系列检测到的 CSV 表格

语法

Delphi

Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
  Format, Options: Integer): WideString;

ActiveX

Function PDFlib::ExtractStructuredDocument(PageRange As String,
  Format As Long, Options As Long) As String

DLL

const wchar_t* DLExtractStructuredDocument(int InstanceID,
  const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
  const char* PageRange, int Format, int Options);

参数

PageRange从 1 开始的页面范围,例如 1-3,7;空字符串表示每一页
FormatPDF_STRUCTURED_TEXT_JSON (0)、PDF_STRUCTURED_TEXT_XHTML (1) 或 PDF_STRUCTURED_TEXT_CSV (2)
Options零或 PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1)

返回值

JSON 包含带版本的 pages 数组,XHTML 则为每个选定页面包含一个语义 section

CSV 仅包含检测到的表,未选择页面包含表时为空

无效范围、格式或选项以及任何提取失败都会返回空字符串

备注

组装输出时仅保留当前页面的文本模型,因此用于几何和层级的提取内存取决于所选页面中最复杂的页面,而非文档页数

调用返回前会恢复所选页面

进度和协作式取消使用常规文档操作生命周期

无效输入时 LastErrorCode 为 111,提取失败时为 515

另请参阅

ExtractStructuredPage、ExtractPageRangeText