GetPageTextA

抽出、ページ操作

説明

末尾の A は ANSI(char)DLL エントリポイントを示します。ActiveX/COM インターフェースでは Unicode 形式のみを公開します。動作は GetPageText と同じで、文字列引数は現在の SetAnsiMode コードページを使用して解釈されます

この関数は選択したページからテキストを抽出するための 2 つの異なる方法を提供し、結果をさまざまな形式で提示します

SetTextExtractionWordGap、SetTextExtractionOptions、および SetTextExtractionArea

関数を使用してテキスト抽出処理を調整できます

構文

Delphi

Function DLGetPageTextA(InstanceID, ExtractOptions: Integer): PAnsiChar;

DLL

const char * DLGetPageTextA(int InstanceID, int ExtractOptions);

パラメータ

ExtractOptions標準テキスト抽出アルゴリズムの使用: 0 = 人が読める形式でテキストを抽出 1 = 非推奨 2 = ページ上の各テキスト部分のフォント、色、サイズ、位置を含む CSV 文字列を返す より正確だが低速なテキスト抽出アルゴリズムの使用: 3 = ページ上の各テキスト部分について、Font Name, Text Color, Text Size, X1, Y1, X2, Y2, X3, Y3, X4, Y4, Text の形式で CSV 文字列を返す 座標はテキストを囲む 4 点で、SetMeasurementUnits 関数で設定した単位と SetOrigin 関数で設定した原点を使用して測定します。座標順は左下隅から反時計回りです。4 = オプション 3 と似ていますが、単語ごとに返して検索を容易にします 5 = オプション 3 と似ていますが、各テキストブロックの後に文字幅を出力します 6 = オプション 4 と似ていますが、各テキスト行の後に文字幅を出力します 7 = オプション 0 より高精度で人が読める形式のテキストを抽出します 8 = オプション 0 と似た出力形式で、より正確なアルゴリズムを使用し、書式なしの行を返します 9 = 視覚的な読み上げ順でテキストを抽出します。再帰的 XY カットにより、複数列レイアウトを行の交互配置ではなく列ごとに保持します 10 = テーブル対応のタブ区切りエクスポートです。ブロック左端をグローバル列位置へクラスタリングし、垂直に揃ったセルを行間でも整列させます 11 = レイアウトを保持する固定グリッドテキストです。ページを実際の空白でパディングした等幅文字グリッドへマッピングし、タブ位置なしで視覚的配置を保持します

戻り値

選択したページのテキスト。問題が発生した場合は空文字列。行は CR-LF 文字で区切られます