THotPDF.ExtractLoadedPageText 方法

 

THotPDF.ExtractLoadedPageText

THotPDF

 

顶部

从已加载页面提取文本为 Unicode 字符串,不做布局聚类,成功时返回 True

 

Delphi 语法:

function ExtractLoadedPageText(PageIndex: Integer; out AText: UnicodeString): boolean;

 

说明

可用的 /ToUnicode CMap 始终是权威来源;缺失的条目会依次回退到 /Encoding /Differences 字形名(经 Adobe Glyph List 解析)、code 到 CID 的映射和 Adobe CID 集合,最后是二进制 /CIDToGIDMap 数据配合内嵌 TrueType 或 OpenType 字体的 cmap

内嵌 cmap 的恢复支持 BMP 和增补平面的映射;当已加载文本替换需要把 Unicode 标量编码回原字体时,沿同一条回退链反向执行

扫描页面可以通过 Searchable OCR Text Layers 获得可搜索的 ToUnicode 内容