GetPageTextA

Wyodrębnianie, Przetwarzanie stron

Opis

Końcowa litera A oznacza punkt wejścia DLL ANSI (char); powierzchnia ActiveX/COM udostępnia wyłącznie postać Unicode. Zachowanie jest identyczne jak w GetPageText, a argumenty ciągów są interpretowane przy użyciu bieżącej strony kodowej SetAnsiMode

Ta funkcja udostępnia dwie różne metody wyodrębniania tekstu z wybranej strony i przedstawia wyniki w wielu formatach

SetTextExtractionWordGap, SetTextExtractionOptions i SetTextExtractionArea

funkcji można użyć do dostosowania procesu wyodrębniania tekstu

Składnia

Delphi

Function DLGetPageTextA(InstanceID, ExtractOptions: Integer): PAnsiChar;

DLL

const char * DLGetPageTextA(int InstanceID, int ExtractOptions);

Parametry

ExtractOptionsStandardowy algorytm wyodrębniania tekstu: 0 = Wyodrębnia tekst w formacie czytelnym dla człowieka 1 = Przestarzałe 2 = Zwraca ciąg CSV zawierający czcionkę, kolor, rozmiar i położenie każdego fragmentu tekstu na stronie Dokładniejszy, ale wolniejszy algorytm wyodrębniania tekstu: 3 = Zwraca ciąg CSV dla każdego fragmentu tekstu na stronie w formacie: Font Name, Text Color, Text Size, X1, Y1, X2, Y2, X3, Y3, X4, Y4, Text. Współrzędne są czterema punktami ograniczającymi tekst, mierzonymi w jednostkach ustawionych funkcją SetMeasurementUnits i względem początku ustawionego funkcją SetOrigin. Kolejność współrzędnych jest przeciwna do ruchu wskazówek zegara, począwszy od lewego dolnego narożnika. 4 = Podobnie do opcji 3, ale zwracane są pojedyncze słowa, co ułatwia wyszukiwanie 5 = Podobnie do opcji 3, ale po każdym bloku tekstu zwracane są szerokości znaków 6 = Podobnie do opcji 4, ale po każdym wierszu tekstu zwracane są szerokości znaków 7 = Wyodrębnia tekst w formacie czytelnym dla człowieka z większą dokładnością niż opcja 0 8 = Format wyjściowy podobny do opcji 0, ale z użyciem dokładniejszego algorytmu. Zwraca niesformatowane wiersze. 9 = Wyodrębnia tekst w wizualnej kolejności czytania: rekurencyjny podział XY zachowuje układy wielokolumnowe kolumna po kolumnie zamiast przeplatania wierszy. 10 = Eksport tabel rozdzielany tabulatorami: lewe krawędzie bloków są grupowane w globalne pozycje kolumn, dzięki czemu pionowo wyrównane komórki zachowują wyrównanie między wierszami. 11 = Tekst w siatce o stałej szerokości zachowującej układ: strona jest odwzorowana na siatkę znaków o stałej szerokości, dopełnioną rzeczywistymi spacjami, co zachowuje wyrównanie wizualne bez tabulatorów

Wartości zwracane

Tekst wybranej strony albo pusty ciąg, jeśli wystąpił problem. Wiersze są rozdzielane znakami CR-LF