结构化已加载页面导出

THotPDF.ExportLoadedPagesStructured 将选定的已加载页面转换为一个 UTF-8 HTML、XHTML、XML 或 JSON 文档,而不修改 PDF

单一语义模型

每种格式都消费同一个无障碍阅读模型,因此结构顺序、文档语言与标题、标题层级、列表、表格、图形、marked-content 替换、对象引用、导航、页面标签、注释和表单控件在各导出器之间保持一致

标记结构能在为页面提供可用投影时优先使用;几何段落、标题、列表、题注、列和表格分析只作为配置的回退

生成在有界的暂存流中完成,发布时会对任何将被覆盖的目标字节做快照,最终写入失败时可以恢复原始流状态

每个跨度携带安全转义的 Unicode 文本,以及可选的页面空间边界、源内容流对象标识、源字体资源和磅值

无障碍结构与交互

HTML 与 XHTML 使用语义元素和稳定的页面锚点;XML 和 JSON 保留等价的 begin、end、content、object-reference、interaction、outline 和 page-label 记录

行内与命名的 marked-content 属性会跨页面流和递归 Form XObject 解析,ActualText 替换可视字形文本,artifact 不进入无障碍模型,图形替代文本通过标记内容而不是视觉顺序关联

安全的 http、https、mailto 和本地目标可以导出;可执行的或带控制字符的 URI 会被略去

表单名称、标签、选项、状态和普通值可以保留;口令、文件选择、NoExport 和签名载荷绝不进入共享导出模型

图像

图像 XObject 出现保留其资源名称、对象编号、固有像素大小和变换后的页面空间边界

simEmbeddedPNG 通过正常的图像管线解码每个受支持的图像并发出 PNG 数据 URI,而 simMetadataOnly 避免像素物化,simOmit 排除图像

有界原子输出

在完成的缓冲区复制到调用方流之前,强制执行页面、字形、图像计数、结构节点、大纲、每页交互、每字段选项、图像字节、聚合图像、输出字节和取消限制

提取和预算失败使目标保持不变,而目标写入失败尝试恢复其原始位置和大小

相关 API