THotPDF.ExtractLoadedPageText Method

 

THotPDF.ExtractLoadedPageText

THotPDF

 

Top

Izdvaja tekst sa učitane stranice kao Unicode niz bez klasteriranja rasporeda. Vraća True ako je uspješno.

 

Delphi syntax:

function ExtractLoadedPageText(PageIndex: Integer; out AText: UnicodeString): boolean;

 

Description

Dostupna CMap tablica /ToUnicode ostaje autoritativna; nedostajući unosi padaju na nazive glifova iz /Encoding /Differences razriješene kroz Adobe Glyph List, preslikavanja koda u CID i Adobe CID zbirke, a zatim na binarne podatke /CIDToGIDMap udružene s ugrađenim TrueType ili OpenType cmap-om

Oporavak ugrađenih cmap tablica podržava BMP i dopunske ravnine, a isti slijed rezervnih koraka odvija se obrnutom stranom kada zamjena učitanog teksta mora Unicode skalar ponovno kodirati u izvorni font

Tekst se vraća u redoslijedu toka sadržaja. Novi redak počinje tamo gdje se tekst pomakne preko vlastitog smjera za više od pola visine teksta, tako podignuti indeksi ostanu u svom retku, a rotirani tekst drži svoje znakove zajedno. Razmak se dodaje tamo gdje dokument razdvaja riječi pomicanjem položaja teksta umjesto prikazom znaka razmaka, tj. gdje praznina nakon vlastite širine glifa prelazi 0.15 visine teksta; razmak se ne dodaje između dvaju kineskih, japanskih ili korejskih znakova

Vraća se samo tekst koji stranica prikazuje: glifovi čiji okvir leži izvan vidljivog područja koje daje GetLoadedPageVisibleBox, poput tiskarskih oznaka stranice podrezane njenim crop okvirom, ostaju izvan. Znak ponovno naslikan preko sebe u istoj veličini, kao u presnimljenim logotipima i podebljanju lažiranom dvostrukim crtanjem teksta s malim pomakom, čita se jedanput. ExtractLoadedPageGlyphs i dalje vraća svaki glif s njegovim položajem

Tekst koji stranica crta kroz Form XObjecte, poput zaglavlja stranica, vodenih žigova i pečata, dio je teksta stranice. Pojavljuje se tamo gdje se forma crta u toku sadržaja i smješta kroz formnu matricu, u forminim vlastitim fontovima; forme ugniježđene u formama također se prate. Isto vrijedi za ExtractLoadedPageTextLayout, ExtractLoadedPageTextColumns i semantičke tekstualne metode

Scanned pages can gain searchable ToUnicode content through Searchable OCR Text Layers