GetPageTextA
擷取、頁面操作
描述
結尾的 A 表示 ANSI(char)DLL 進入點;ActiveX/COM 介面只提供 Unicode 形式。行為與 GetPageText 完全相同,字串參數依目前 SetAnsiMode 的字碼頁解讀
此函式提供兩種從所選頁面擷取文字的方法,並以多種格式呈現結果。
SetTextExtractionWordGap、SetTextExtractionOptions 與 SetTextExtractionArea
函式可用來調整文字擷取流程。
語法
Delphi
Function DLGetPageTextA(InstanceID, ExtractOptions: Integer): PAnsiChar;
DLL
const char * DLGetPageTextA(int InstanceID, int ExtractOptions);
參數
| ExtractOptions | 標準文字擷取演算法:0 = 以人類可讀格式擷取文字 1 = 已淘汰 2 = 傳回 CSV 字串,含頁面上每段文字的字型、顏色、大小與位置 較精準但較慢的文字擷取演算法:3 = 為頁面上每段文字傳回一行 CSV,格式為:字型名稱、文字顏色、文字大小、X1、Y1、X2、Y2、X3、Y3、X4、Y4、文字 座標是包住文字的四個點,以 SetMeasurementUnits 函式設定的單位與 SetOrigin 函式設定的原點量測,順序為逆時針、左下角在前。 4 = 類似選項 3,但傳回個別單字,方便搜尋單字 5 = 類似選項 3,但在每段文字之後輸出字元寬度 6 = 類似選項 4,但在每行文字之後輸出字元寬度 7 = 以人類可讀格式擷取文字,精準度高於選項 0 8 = 輸出格式同選項 0,但使用較精準的演算法。傳回未格式化的行。 9 = 以視覺閱讀順序擷取文字:遞迴 XY 切割讓多欄版面按欄輸出,行不交錯。 10 = 表格感知的 tab 分隔匯出:區塊左緣聚類成全域欄位位置,垂直對齊的儲存格跨列仍保持對齊。 11 = 保留版面的固定網格文字:頁面映射到等寬字元網格並以實際空格填補,不用 tab 定位也能維持視覺對齊。 |
|---|
傳回值
| 所選頁面的文字;發生問題時為空字串。各行以 CR-LF 字元分隔。 |