GetPageTextA
提取、页面操作
描述
末尾的 A 表示 ANSI(char)DLL 入口点;ActiveX/COM 接口仅公开 Unicode 形式。其行为与 GetPageText 相同,字符串参数使用当前 SetAnsiMode 代码页进行解释
此函数提供两种从选定页面提取文本的方法,并以多种格式呈现结果
SetTextExtractionWordGap、SetTextExtractionOptions 和 SetTextExtractionArea
可使用函数调整文本提取过程
语法
Delphi
Function DLGetPageTextA(InstanceID, ExtractOptions: Integer): PAnsiChar;
DLL
const char * DLGetPageTextA(int InstanceID, int ExtractOptions);
参数
| ExtractOptions | 使用标准文本提取算法:0 = 以人类可读格式提取文本 1 = 已弃用 2 = 返回 CSV 字符串,其中包含页面上每段文本的字体、颜色、大小和位置 使用更准确但更慢的文本提取算法:3 = 为页面上的每段文本返回 CSV 字符串,格式如下:字体名称、文本颜色、文本大小、X1、Y1、X2、Y2、X3、Y3、X4、Y4、文本 坐标是文本边界的四个点,使用由 SetMeasurementUnits 函数设置的单位以及由 SetOrigin 函数设置的原点测量。坐标顺序为逆时针,先是左下角。4 = 类似选项 3,但返回单个词,使词语搜索更容易 5 = 类似选项 3,但在每个文本块后输出字符宽度 6 = 类似选项 4,但在每行文本后输出字符宽度 7 = 以人类可读格式提取文本,准确性高于选项 0 8 = 输出格式类似选项 0,但使用更准确的算法,返回未格式化的行 9 = 按视觉阅读顺序提取文本:递归 XY-cut 按列保留多栏布局,而不交错各行 10 = 感知表格的制表符分隔导出:块的左边缘聚类为全局列位置,使垂直对齐的单元格跨行保持对齐 11 = 保留布局的固定网格文本:页面映射到以真实空格填充的等宽字符网格,在不使用制表位的情况下保持视觉对齐 |
|---|
返回值
| 所选页面的文本,发生问题时为空字符串。各行以 CR-LF 字符分隔 |