GetPageText
Извличане, работа със страници
Описание
Тази функция предоставя два различни метода за извличане на текст от избраната страница и представя резултатите в разнообразни формати
Функциите SetTextExtractionWordGap, SetTextExtractionOptions и SetTextExtractionArea
могат да се използват за настройване на процеса на извличане на текст
Синтаксис
Delphi
Function TPDFlib.GetPageText(ExtractOptions: Integer): WideString;
ActiveX
Function PDFlib::GetPageText(ExtractOptions As Long) As String
DLL
const wchar_t * DLGetPageText(int InstanceID, int ExtractOptions);
Параметри
| ExtractOptions | При използване на стандартния алгоритъм за извличане на текст: 0 = Извлича текста в четим за хора формат 1 = Изведено от употреба 2 = Връща CSV низ, включващ шрифта, цвета, размера и позицията на всяка част от текста на страницата При използване на по-точния, но по-бавен алгоритъм за извличане на текст: 3 = Връща CSV низ за всяка част от текста на страницата със следния формат: Font Name, Text Color, Text Size, X1, Y1, X2, Y2, X3, Y3, X4, Y4, Text Координатите са четирите точки, ограждащи текста, измерени с единиците, зададени с функцията SetMeasurementUnits, и началната точка, зададена с функцията SetOrigin. Редът на координатите е обратно на часовниковата стрелка, като първо е долният ляв ъгъл 4 = Подобно на опция 3, но се връщат отделни думи, което улеснява търсенето на думи 5 = Подобно на опция 3, но ширините на знаците се извеждат след всеки блок текст 6 = Подобно на опция 4, но ширините на знаците се извеждат след всеки ред текст 7 = Извлича текста в четим за хора формат с подобрена точност спрямо опция 0 8 = Форматът на изхода е подобен на опция 0, но използва по-точния алгоритъм. Връща неформатирани редове |
|---|
Връщани стойности
| Текстът на избраната страница или празен низ, ако е възникнал проблем. Редовете са разделени с CR-LF знаци |