THotPDF.ExtractLoadedPageText
|
Į viršų |
Ištraukia tekstą iš įkeltojo puslapio kaip Unikodo eilutę be išdėstymo klasterizacijos ir grąžina True, kai pavyksta
Delphi sintaksė: function ExtractLoadedPageText(PageIndex: Integer; out AText: UnicodeString): boolean;
Aprašymas Turima Įterptosios cmap atkūrimas palaiko BMP ir papildomųjų plokštumų atvaizdus, o ta pati atsarginių kelio grandinė eina atvirkščiai, kai įkeltųjų tekstų pakeitimas turi Unikodo skaliarą vėl užkoduoti originaliajame šrifte Tekstas grąžinamas turinio srauto (content stream) tvarka. Nauja eilutė prasideda ten, kur tekstas peržengia savo paties kryptį daugiau nei per pusę teksto aukščio, todėl pakelti viršutiniai indeksai lieka savo eilutėje, o pasuktas tekstas laiko simbolius kartu. Tarpas įterpiamas ten, kur dokumentas žodžius skiria perkeliant teksto poziciją, o ne rodant tarpo simbolį, t. y. kur tarpas po paties glifo pločio viršija 0.15 teksto aukščio; tarp dviejų kinų, japonų arba korėjiečių simbolių tarpas neįterpiamas Grąžinamas tik tekstas, kurį puslapis rodo: glifai, kurių dėžė yra už matomosios srities, kurią nurodo GetLoadedPageVisibleBox, ribų — pavyzdžiui, spausdinimo ženklai, kai puslapis apkarpytas pagal jo crop box — paliekami. Simbolis, vėl nudažytas ant savęs tuo pačiu dydžiu, kaip antspauduotuose logotipuose arba pastorintime, imituotame piešiant tekstą du kartus su nedideliu poslinkiu, skaitomas kartą. ExtractLoadedPageGlyphs vis tiek grąžina kiekvieną glifą su jo pozicija Tekstas, kurį puslapis piešia per Form XObjects — pavyzdžiui, puslapio antraštes, vandens ženklus ir antspaudus — yra puslapio teksto dalis. Jis atsiranda ten, kur forma nupiešiama turinio sraute, ir išdėstoma per formos matricą, formos paties šriftais; į viena į kitą įdėtos formos taip pat seka. Tas pats taikoma ExtractLoadedPageTextLayout, ExtractLoadedPageTextColumns ir semantiniams teksto metodams Skenuotieji puslapiai ieškomojo ToUnicode turinio gali įgyti per Searchable OCR Text Layers
|