|
THotPDF.ExtractLoadedPageText
|
Top |
|
Izdvaja tekst sa učitane stranice kao Unicode niz bez klasteriranja rasporeda. Vraća True ako je uspješno.
Delphi syntax: function ExtractLoadedPageText(PageIndex: Integer; out AText: UnicodeString): boolean;
Description Dostupna CMap tablica Oporavak ugrađenih cmap tablica podržava BMP i dopunske ravnine, a isti slijed rezervnih koraka odvija se obrnutom stranom kada zamjena učitanog teksta mora Unicode skalar ponovno kodirati u izvorni font Tekst se vraća u redoslijedu toka sadržaja. Novi redak počinje tamo gdje se tekst pomakne preko vlastitog smjera za više od pola visine teksta, tako podignuti indeksi ostanu u svom retku, a rotirani tekst drži svoje znakove zajedno. Razmak se dodaje tamo gdje dokument razdvaja riječi pomicanjem položaja teksta umjesto prikazom znaka razmaka, tj. gdje praznina nakon vlastite širine glifa prelazi 0.15 visine teksta; razmak se ne dodaje između dvaju kineskih, japanskih ili korejskih znakova Vraća se samo tekst koji stranica prikazuje: glifovi čiji okvir leži izvan vidljivog područja koje daje GetLoadedPageVisibleBox, poput tiskarskih oznaka stranice podrezane njenim crop okvirom, ostaju izvan. Znak ponovno naslikan preko sebe u istoj veličini, kao u presnimljenim logotipima i podebljanju lažiranom dvostrukim crtanjem teksta s malim pomakom, čita se jedanput. ExtractLoadedPageGlyphs i dalje vraća svaki glif s njegovim položajem Tekst koji stranica crta kroz Form XObjecte, poput zaglavlja stranica, vodenih žigova i pečata, dio je teksta stranice. Pojavljuje se tamo gdje se forma crta u toku sadržaja i smješta kroz formnu matricu, u forminim vlastitim fontovima; forme ugniježđene u formama također se prate. Isto vrijedi za ExtractLoadedPageTextLayout, ExtractLoadedPageTextColumns i semantičke tekstualne metode Scanned pages can gain searchable ToUnicode content through Searchable OCR Text Layers
|