GetLastStructuredTextDiagnostics

文本、提取、结构化数据

描述

返回描述本实例最近一次结构化提取分析的 JSON

语法

Delphi

Function TPDFlib.GetLastStructuredTextDiagnostics: WideString;

DLL

Function DLGetLastStructuredTextDiagnostics(InstanceID: Integer): PWideChar; Stdcall;
Function DLGetLastStructuredTextDiagnosticsA(InstanceID: Integer): PAnsiChar; Stdcall;

ActiveX

Function PDFlib::GetLastStructuredTextDiagnostics() As String

报告

{
  "status": "completed",
  "pages": [
    {
      "page": 1,
      "readingSource": "tagged",
      "warnings": ""
    },
    {
      "page": 2,
      "readingSource": "mixed",
      "warnings": "shared-tagged-form-occurrence-order-unresolved\r\n"
    }
  ]
}

初始报告为 {"status":"notRun"};提取尝试以 {"status":"error","code":"extraction_failed"} 开始,分析成功后会替换为 completed 报告

每个完成的页面记录其一基 page、readingSource 与 warnings;warnings 是以换行分隔的诊断代码字符串,而 schema 2 结构化 JSON 使用 warnings 数组

阅读顺序来源有 tagged、mixed、geometric 与 geometric-columns

备注

该报告覆盖结构化 JSON、XHTML、CSV、Markdown 与 DOCX 提取;在提取之前被拒绝的无效请求可能使先前报告保持不变

报告完成只表示分析成功返回,并不证明语义完整、布局推断正确、标记有效或符合 PDF/UA

警告会披露不受支持的对象引用文本、未解析的角色或命名空间、循环或遍历限制、缺失的来源映射,以及含糊的共享 Form XObject 出现

当结构遍历或绑定不完整时,提取的源文本会通过 mixed 或 geometric 回退保留;每个块的来源信息与 structureComplete 请查看 ExtractStructuredPage

取消或提取失败可能留下错误报告;调用结果请结合 LastErrorCode 与常规操作生命周期判断

该 getter 不清除最近的错误;DLL A 变体返回 UTF-8,DLL 字符串指针在本实例下一次返回字符串的调用之前保持有效

另请参阅

SetStructuredTextOptions、GetStructuredTextOptions、ExtractStructuredDocument、ExportDocumentMarkdown、SaveDOCXToStream