|
THotPDF.ExtractLoadedPageText
|
Vrh |
|
Ekstrahuje tekst sa učitane stranice kao Unicode string bez klasterovanja rasporeda. Vraća True ako je uspešno.
Delphi sintaksa: function ExtractLoadedPageText(PageIndex: Integer; out AText: UnicodeString): boolean;
Opis Ekstrahuje tekst sa učitane stranice kao Unicode string bez klasterovanja rasporeda. Vraća True ako je uspešno. Oporavak ugrađenog cmap podržava BMP i supplementarno-ravinska mapiranja, a isti lanac rezervnih opcija se obrće kada zamena učitanog teksta mora da kodira Unicode skalar nazad u originalni font Tekst se vraća u redosledu toka sadržaja. Novi red počinje tamo gde se tekst pomeri preko sopstvenog smera za više od polovine visine teksta, pa podignuti superskripti ostaju u svom redu, a rotirani tekst drži svoje znakove zajedno. Razmak se dodaje tamo gde dokument razdvaja reči pomeranjem tekst pozicije umesto prikaza znaka razmaka, to jest tamo gde praznina posle sopstvene širine glifa premašuje 0,15 visine teksta; između dva kineska, japanska ili korejska znaka razmak se ne dodaje Vraća se samo tekst koji stranica prikazuje: glifovi čiji je okvir van vidljivog područja datog kroz GetLoadedPageVisibleBox, poput štamparskih marki stranice osečene njenim crop okvirom, ostavljaju se po strani. Znak ponovo naslikan preko sebe na istoj veličini, kao u preofarbanim logotipima i podebljanju lažiranom dvostrukim crtanjem teksta s malim pomeranjem, čita se jednom. ExtractLoadedPageGlyphs i dalje vraća svaki glif sa njegovom pozicijom Tekst koji stranica crta kroz Form XObjects, poput zaglavlja stranice, vodenih žigova i pečata, deo je teksta stranice. Pojavljuje se tamo gde se forma crta u toku sadržaja i postavlja se kroz matricu forme, u fontovima same forme; forme ugneždene u forme takođe se prate. Isto važi za ExtractLoadedPageTextLayout, ExtractLoadedPageTextColumns i semantičke tekst metode Skenirane stranice mogu dobiti searchable ToUnicode sadržaj kroz Slojevi teksta OCR-a koji se mogu pretražiti
|