GetPageText

Извличане, работа със страници

Описание

Тази функция предоставя два различни метода за извличане на текст от избраната страница и представя резултатите в разнообразни формати

Функциите SetTextExtractionWordGap, SetTextExtractionOptions и SetTextExtractionArea

могат да се използват за настройване на процеса на извличане на текст

Синтаксис

Delphi

Function TPDFlib.GetPageText(ExtractOptions: Integer): WideString;

ActiveX

Function PDFlib::GetPageText(ExtractOptions As Long) As String

DLL

const wchar_t * DLGetPageText(int InstanceID, int ExtractOptions);

Параметри

ExtractOptionsПри използване на стандартния алгоритъм за извличане на текст: 0 = Извлича текста в четим за хора формат 1 = Изведено от употреба 2 = Връща CSV низ, включващ шрифта, цвета, размера и позицията на всяка част от текста на страницата При използване на по-точния, но по-бавен алгоритъм за извличане на текст: 3 = Връща CSV низ за всяка част от текста на страницата със следния формат: Font Name, Text Color, Text Size, X1, Y1, X2, Y2, X3, Y3, X4, Y4, Text Координатите са четирите точки, ограждащи текста, измерени с единиците, зададени с функцията SetMeasurementUnits, и началната точка, зададена с функцията SetOrigin. Редът на координатите е обратно на часовниковата стрелка, като първо е долният ляв ъгъл 4 = Подобно на опция 3, но се връщат отделни думи, което улеснява търсенето на думи 5 = Подобно на опция 3, но ширините на знаците се извеждат след всеки блок текст 6 = Подобно на опция 4, но ширините на знаците се извеждат след всеки ред текст 7 = Извлича текста в четим за хора формат с подобрена точност спрямо опция 0 8 = Форматът на изхода е подобен на опция 0, но използва по-точния алгоритъм. Връща неформатирани редове

Връщани стойности

Текстът на избраната страница или празен низ, ако е възникнал проблем. Редовете са разделени с CR-LF знаци