SetStructuredTextOptions

Texto, extracción, datos estructurados

Descripción

Establece las opciones de análisis de la instancia para la extracción a JSON estructurado, XHTML, CSV, Markdown y DOCX

Sintaxis

Delphi

Function TPDFlib.SetStructuredTextOptions(Options: Integer): Integer;

DLL

Function DLSetStructuredTextOptions(InstanceID: Integer; Options: Integer): Integer; Stdcall;

ActiveX

Function PDFlib::SetStructuredTextOptions(Options As Long) As Long

Parámetros

Options combina los indicadores siguientes; PDF_STRUCTURED_ADVANCED_DEFAULT es 11 y activa la detección de columnas, de elementos accesorios y la continuación de tablas

ConstanteValorComportamiento
PDF_STRUCTURED_DETECT_COLUMNS1Busca huecos de columna geométricos coherentes cuando no hay disponible un orden etiquetado
PDF_STRUCTURED_DETECT_FURNITURE2Identifica texto repetido cerca de los márgenes de página en las páginas seleccionadas, incluidos los números de página
PDF_STRUCTURED_EXCLUDE_FURNITURE4Omite de los bloques serializados los encabezados, pies, números de página y artefactos explícitos identificados
PDF_STRUCTURED_JOIN_TABLES8Coordina fragmentos de páginas consecutivas de la misma tabla etiquetada, o tablas geométricamente compatibles cerca de los bordes de páginas enfrentadas
PDF_STRUCTURED_INFER_MERGES16Infiere celdas combinadas horizontales en tablas geométricas; las combinaciones inferidas conservan la procedencia geométrica y la confianza

Valores devueltos

Devuelve 1 en caso de éxito o 0 para una máscara no válida; los valores negativos y los bits desconocidos se rechazan con LastErrorCode 111 y se conserva la configuración anterior

Observaciones

La configuración persiste en esta instancia entre documentos y se aplica a las extracciones posteriores; es independiente del argumento Options específico de formato de cada función de exportación

Cero desactiva estos pasos de análisis opcionales conservando el orden real del árbol de etiquetas, los roles resueltos, las vinculaciones de contenido marcado, ActualText y las celdas de tablas etiquetadas

La detección de elementos accesorios conserva el texto de forma predeterminada; la eliminación requiere el indicador explícito de exclusión, y la detección de márgenes repetidos requiere varias páginas seleccionadas

El orden de lectura etiquetado sigue la secuencia /K mixta completa, incluidos los elementos hijo y las referencias de contenido; las columnas geométricas son un recurso alternativo y se etiquetan por separado

La detección de columnas admite hasta ocho columnas geométricas y es heurística; la clasificación de márgenes repetidos, la continuación geométrica de tablas y las combinaciones inferidas pueden ser imprecisas con maquetaciones inusuales

Las extensiones de celdas etiquetadas proceden de los atributos de estructura; la inferencia geométrica de combinaciones es opcional y no establece corrección semántica

La continuación de tablas requiere fragmentos en orden ascendente en páginas de origen consecutivas y rejillas de columnas compatibles; las páginas invertidas, repetidas o no consecutivas no se unen forzadamente

El setter borra el último error antes de validar la máscara

Véase también

GetStructuredTextOptions, GetLastStructuredTextDiagnostics, ExtractStructuredDocument, ExportDocumentMarkdown, SaveDOCXToStream