|
THotPDF.ExtractLoadedPageText
|
Top |
|
Извлича текст от заредена страница като Unicode низ без клъстериране на оформлението. Връща True при успех
Delphi syntax: function ExtractLoadedPageText(PageIndex: Integer; out AText: UnicodeString): boolean;
Описание Извлича текст от заредена страница като Unicode низ без клъстериране на оформлението. Връща True при успех.An available Възстановяването на вграден cmap поддържа съпоставки за BMP и допълнителната равнина, а същата верига с резерви варианти се обръща, когато замяната на зареден текст трябва да кодира Unicode скалар обратно в оригиналния шрифт Текстът се връща в реда на content stream. Нов ред започва там, където текстът се премества напречно на собствената си посока с повече от половината текстова височина, така че повдигнатите горни индекси остават на реда си, а завъртеният текст държи знаците си заедно. Интервал се добавя там, където документът разделя думи чрез преместване на текстовата позиция вместо да покаже знак за интервал, тоест там, където празното пространство след собствена ширина на глиф надвишава 0,15 от текстовата височина; между два китайски, японски или корейски знака не се добавя интервал Връща се само текстът, който страницата показва: глифи, чиято кутия лежи извън видимата област, зададена от GetLoadedPageVisibleBox, като печатните знаци на страница, подрязана от нейния crop box, се пропускат. Знак, нарисуван отново върху себе си със същия размер, както при надпечатани лога и bold, имитиран чрез двукратно чертане на текста с малко отместване, се чете веднъж. ExtractLoadedPageGlyphs продължава да връща всеки глиф с позицията му Текст, който страницата рисува чрез Form XObjects, като заглавки на страници, водни знаци и печати, е част от текста на страницата. Той се появява там, където формата е нарисувана в content stream, и се поставя чрез матрицата на формата, с нейните собствени шрифтове; форми, вложени във форми, също се проследяват. Същото важи за ExtractLoadedPageTextLayout, ExtractLoadedPageTextColumns и семантичните текстови методи Сканираните страници могат да получат търсимо ToUnicode съдържание чрезSearchable OCR Text Layers
|