|
THotPDF.ExtractLoadedPageText
|
Vrh |
|
Izlušči besedilo z naložene strani kot niz Unicode brez grozdenja po postavitvi in vrne True, če je uspešno
Delphi syntax: function ExtractLoadedPageText(PageIndex: Integer; out AText: UnicodeString): boolean;
Description Razpoložljiv CMap Obnovitev vgrajenega cmap podpira preslikave BMP in dodatnih ravnin, ista veriga odpovedi pa se obrne, kadar mora zamenjava naloženega besedila skalar Unicode kodirati nazaj v izvorno pisavo Besedilo se vrne v vrstnem redu toka vsebine. Nova vrstica se začne tam, kjer se besedilo čez svojo smer premakne za več kot polovico višine besedila, zato dvignjena nadpisana besedila ostanejo v svoji vrstici in rotirano besedilo ohrani znake skupaj. Presledek se doda tam, kjer dokument ločuje besede s premikom besedilnega položaja namesto s prikazom znaka za presledek, to je, kjer vrzel po lastni širini glifa preseže 0,15 višine besedila; med dvema kitajskema, japonskima ali korejskima znakoma se presledek ne doda Vrne se le besedilo, ki ga stran prikazuje: glifi, katerih okvir leži izven vidnega območja, ki ga poda GetLoadedPageVisibleBox, na primer tiskarske oznake strani, obrezane s svojim crop boxom, se izpustijo. Znak, naslikan znova čez sebe na isti velikosti, kot pri prebarvanih logotipih in krepku, ponarejenem z dvojnim risanjem besedila z majhnim odmikom, se prebere enkrat. ExtractLoadedPageGlyphs še vedno vrne vsak glif s svojim položajem Besedilo, ki ga stran riše prek Form XObjectov, na primer glave strani, vodne žige in žigi, je del besedila strani. Pojavi se tam, kjer je form naslikan v toku vsebine, in se postavi prek matrike forma, v lastnih pisavah forma; sledi se tudi formom, ugnezdenim v formih. Enako velja za ExtractLoadedPageTextLayout, ExtractLoadedPageTextColumns in semantične metode besedila Pregledane strani lahko dobijo iskalno vsebino ToUnicode prek Searchable OCR Text Layers
|