SetStructuredTextOptions
Texto, extracción, datos estructurados
Descripción
Establece las opciones de análisis de la instancia para la extracción a JSON estructurado, XHTML, CSV, Markdown y DOCX
Sintaxis
Delphi
Function TPDFlib.SetStructuredTextOptions(Options: Integer): Integer;DLL
Function DLSetStructuredTextOptions(InstanceID: Integer; Options: Integer): Integer; Stdcall;ActiveX
Function PDFlib::SetStructuredTextOptions(Options As Long) As LongParámetros
Options combina los indicadores siguientes; PDF_STRUCTURED_ADVANCED_DEFAULT es 11 y activa la detección de columnas, de elementos accesorios y la continuación de tablas
| Constante | Valor | Comportamiento |
|---|---|---|
PDF_STRUCTURED_DETECT_COLUMNS | 1 | Busca huecos de columna geométricos coherentes cuando no hay disponible un orden etiquetado |
PDF_STRUCTURED_DETECT_FURNITURE | 2 | Identifica texto repetido cerca de los márgenes de página en las páginas seleccionadas, incluidos los números de página |
PDF_STRUCTURED_EXCLUDE_FURNITURE | 4 | Omite de los bloques serializados los encabezados, pies, números de página y artefactos explícitos identificados |
PDF_STRUCTURED_JOIN_TABLES | 8 | Coordina fragmentos de páginas consecutivas de la misma tabla etiquetada, o tablas geométricamente compatibles cerca de los bordes de páginas enfrentadas |
PDF_STRUCTURED_INFER_MERGES | 16 | Infiere celdas combinadas horizontales en tablas geométricas; las combinaciones inferidas conservan la procedencia geométrica y la confianza |
Valores devueltos
Devuelve 1 en caso de éxito o 0 para una máscara no válida; los valores negativos y los bits desconocidos se rechazan con LastErrorCode 111 y se conserva la configuración anterior
Observaciones
La configuración persiste en esta instancia entre documentos y se aplica a las extracciones posteriores; es independiente del argumento Options específico de formato de cada función de exportación
Cero desactiva estos pasos de análisis opcionales conservando el orden real del árbol de etiquetas, los roles resueltos, las vinculaciones de contenido marcado, ActualText y las celdas de tablas etiquetadas
La detección de elementos accesorios conserva el texto de forma predeterminada; la eliminación requiere el indicador explícito de exclusión, y la detección de márgenes repetidos requiere varias páginas seleccionadas
El orden de lectura etiquetado sigue la secuencia /K mixta completa, incluidos los elementos hijo y las referencias de contenido; las columnas geométricas son un recurso alternativo y se etiquetan por separado
La detección de columnas admite hasta ocho columnas geométricas y es heurística; la clasificación de márgenes repetidos, la continuación geométrica de tablas y las combinaciones inferidas pueden ser imprecisas con maquetaciones inusuales
Las extensiones de celdas etiquetadas proceden de los atributos de estructura; la inferencia geométrica de combinaciones es opcional y no establece corrección semántica
La continuación de tablas requiere fragmentos en orden ascendente en páginas de origen consecutivas y rejillas de columnas compatibles; las páginas invertidas, repetidas o no consecutivas no se unen forzadamente
El setter borra el último error antes de validar la máscara
Véase también
GetStructuredTextOptions, GetLastStructuredTextDiagnostics, ExtractStructuredDocument, ExportDocumentMarkdown, SaveDOCXToStream