GetLastStructuredTextDiagnostics
文本、提取、结构化数据
描述
返回描述本实例最近一次结构化提取分析的 JSON
语法
Delphi
Function TPDFlib.GetLastStructuredTextDiagnostics: WideString;DLL
Function DLGetLastStructuredTextDiagnostics(InstanceID: Integer): PWideChar; Stdcall;
Function DLGetLastStructuredTextDiagnosticsA(InstanceID: Integer): PAnsiChar; Stdcall;ActiveX
Function PDFlib::GetLastStructuredTextDiagnostics() As String报告
{
"status": "completed",
"pages": [
{
"page": 1,
"readingSource": "tagged",
"warnings": ""
},
{
"page": 2,
"readingSource": "mixed",
"warnings": "shared-tagged-form-occurrence-order-unresolved\r\n"
}
]
}初始报告为 {"status":"notRun"};提取尝试以 {"status":"error","code":"extraction_failed"} 开始,分析成功后会替换为 completed 报告
每个完成的页面记录其一基 page、readingSource 与 warnings;warnings 是以换行分隔的诊断代码字符串,而 schema 2 结构化 JSON 使用 warnings 数组
阅读顺序来源有 tagged、mixed、geometric 与 geometric-columns
备注
该报告覆盖结构化 JSON、XHTML、CSV、Markdown 与 DOCX 提取;在提取之前被拒绝的无效请求可能使先前报告保持不变
报告完成只表示分析成功返回,并不证明语义完整、布局推断正确、标记有效或符合 PDF/UA
警告会披露不受支持的对象引用文本、未解析的角色或命名空间、循环或遍历限制、缺失的来源映射,以及含糊的共享 Form XObject 出现
当结构遍历或绑定不完整时,提取的源文本会通过 mixed 或 geometric 回退保留;每个块的来源信息与 structureComplete 请查看 ExtractStructuredPage
取消或提取失败可能留下错误报告;调用结果请结合 LastErrorCode 与常规操作生命周期判断
该 getter 不清除最近的错误;DLL A 变体返回 UTF-8,DLL 字符串指针在本实例下一次返回字符串的调用之前保持有效
另请参阅
SetStructuredTextOptions、GetStructuredTextOptions、ExtractStructuredDocument、ExportDocumentMarkdown、SaveDOCXToStream