Método THotPDF.ExtractLoadedPageText

 

THotPDF.ExtractLoadedPageText

THotPDF

 

Topo

Extrai o texto de uma página carregada como uma string Unicode sem agrupamento de layout. Retorna True em caso de sucesso.

 

Sintaxe Delphi:

function ExtractLoadedPageText(PageIndex: Integer; out AText: UnicodeString): boolean;

 

Descrição

O CMap /ToUnicode continua autoritativo; as entradas em falta recuam para nomes de glifos /Encoding /Differences resolvidos através da Adobe Glyph List, mapeamentos código-CID e coleções CID da Adobe, e depois para dados binários /CIDToGIDMap combinados com o cmap TrueType ou OpenType incorporado

A recuperação de cmaps incorporados suporta mapeamentos BMP e do plano suplementar, e a mesma cadeia de fallback é invertida quando a substituição de texto carregado tem de codificar um escalar Unicode de volta para a fonte original

O texto é devolvido pela ordem do content stream. Uma nova linha começa onde o texto se desloca através da sua própria direção em mais de metade da altura do texto, pelo que os sobrescritos elevados se mantêm na sua linha e o texto rodado mantém os carateres juntos. Um espaço é acrescentado onde um documento separa palavras movendo a posição do texto em vez de mostrar um carácter de espaço, isto é, onde o vão após a largura do próprio glifo excede 0.15 da altura do texto; não é acrescentado espaço entre dois carateres chineses, japoneses ou coreanos

É devolvido apenas o texto que a página mostra: os glifos cuja caixa fica fora da área visível dada por GetLoadedPageVisibleBox, como as marcas de impressão de uma página aparada pelo seu crop box, ficam de fora. Um carácter pintado de novo sobre si próprio com o mesmo tamanho, como em logótipos sobreimpressos e negrito falsificado desenhando o texto duas vezes com um pequeno desvio, é lido uma vez. ExtractLoadedPageGlyphs continua a devolver todos os glifos com a sua posição

O texto que a página pinta através de Form XObjects, como cabeçalhos de página, marcas de água e carimbos, faz parte do texto da página. Aparece onde o form é pintado no content stream e é colocado através da matriz do form, nas fontes do próprio form; forms aninhados em forms também são seguidos. O mesmo se aplica a ExtractLoadedPageTextLayout, ExtractLoadedPageTextColumns e aos métodos de texto semântico

Páginas digitalizadas podem ganhar conteúdo ToUnicode pesquisável através de Camadas de texto OCR pesquisáveis