function GetStructuredText(
const Options: TPdfStructuredTextOptions): TPdfStructuredTextPage;
GetStructuredText lee escalares Unicode, cajas de caracteres, tamaño de fuente, grosor de fuente, nombre de fuente, ángulo e identidad del objeto de texto a través de las API de texto nativas de PDFium
Los caracteres se convierten en tramos con estilo, los tramos en líneas físicas, las líneas relacionadas horizontalmente en bloques, y el texto de los bloques se une en el campo Text a nivel de página
Cada escalar nativo se conserva como UTF-16, incluidos los caracteres del plano suplementario representados por pares subrogados
ReadingOrder — roPhysicalLayout agrupa por geometría de arriba abajo y de izquierda a derecha; roContentOrder conserva la secuencia nativa del flujo de contenidoIncludeFontInfo — incluye nombre de fuente, tamaño, grosor y ángulo en cada tramo, con valor predeterminado TrueIncludeSemantics — mapea el modelo existente de PDF etiquetado o de contenido legible heurístico en cada bloque, con valor predeterminado TrueMaxCharacters — presupuesto de caracteres de página con fallo controlado, con valor predeterminado 1000000| Registro | Datos clave |
|---|---|
TPdfStructuredTextPage | PageNumber, Width y Height, recuentos de caracteres y de fallos, Source, Text combinado y Blocks |
TPdfStructuredTextBlock | Límites, texto, tipo de estructura, nivel de encabezado, idioma, origen, índice del elemento de estructura y líneas |
TPdfStructuredTextLine | Límites, texto combinado y tramos con estilo |
TPdfStructuredTextSpan | Text, Bounds, el rango SourceStartIndex y SourceCharacterCount, FontName, FontSize, FontWeight y Angle |
Kind, HeadingLevel, Language, Source y StructElementIndexUnmappedCharacterCount cuenta los mapeos nativos a cero reemplazados por U+FFFDGeometryFailureCount cuenta los caracteres sin salto de línea sin límites nativos utilizables, conservando su textoEl ordenamiento físico usa ordenación de caracteres O(n log n), búferes de líneas y tramos de crecimiento geométrico, construcción UTF-16 con búfer y caché de fuentes de objetos de texto adyacentes no nulos
Establezca IncludeFontInfo o IncludeSemantics en False cuando esas capas de enriquecimiento no sean necesarias
var
Options: TPdfStructuredTextOptions;
Page: TPdfStructuredTextPage;
begin
Options := TPdfStructuredTextOptions.Default;
Options.MaxCharacters := 250000;
Page := Pdf1.GetStructuredText(Options);
Memo1.Text := Page.Text;
end;