THotPDF.ExtractLoadedPageSemanticText

Возвращает простой текст в семантическом порядке, который выдаёт геометрический анализ загруженной страницы

Синтаксис Delphi

function ExtractLoadedPageSemanticText(PageIndex: Integer;
  out AText: UnicodeString): boolean;

Описание

Текст внутри колонки выдаётся сверху вниз, прежде чем начнётся следующая колонка. Ячейки таблиц остаются разделёнными табуляцией, а строки таблиц идут по строкам. На переходах между зонами и колонками вставляется пустая строка: видимые границы документа сохраняются, но каждый позиционирующий пробел не воспроизводится

Если нужны метаданные о роли, границах, ячейках, таблицах, списках, колонках или исходном порядке, используйте AnalyzeLoadedPageSemanticText