Typed Table Extraction

THotPDF.ExtractLoadedTypedTables convierte las filas de tablas semánticas en una cuadrícula de columnas canónica pública sin modificar el documento cargado

Continuidad de tablas

Los fragmentos adyacentes compatibles pueden agregar columnas canónicas, convirtiendo los inicios intermedios ausentes en valores ColumnSpan explícitos en lugar de descartar los encabezados combinados

Las tablas compatibles en páginas consecutivas se convierten en una sola tabla, mientras que las filas de encabezado iniciales coincidentes permanecen presentes y llevan IsRepeatedHeader

Valores tipados y confianza

Cada celda conserva el texto Unicode original, los límites del espacio de página, los tramos de fila y columna, el valor normalizado, el almacenamiento tipado, el código de moneda y la confianza

La inferencia reconoce valores vacíos, de cadena, enteros, numéricos, booleanos, de fecha, de fecha y hora, de moneda y de porcentaje bajo las reglas de decimal, millares y orden de fecha seleccionadas por el llamador

Exportación acotada

ExportLoadedTypedTables escribe filas CSV expandidas estilo RFC 4180 o JSON rico en metadatos a través de un flujo de preparación acotado y una publicación final segura frente a reversión

Los límites de página, glifo, tabla de origen, tabla de salida, fila, celda, texto, byte de salida, confianza y cancelación se comprueban antes de publicar los resultados

Libros de trabajo XLSX

La unidad HPDFXLSXExport exporta THPDFTypedTables como un libro de trabajo Office Open XML sin instalar Office ni cargar una biblioteca externa de hojas de cálculo

HPDFExportTypedTablesXLSX escribe en un stream legible, escribible y con seek en su posición actual, prepara el libro de trabajo completo antes de publicarlo y restaura los bytes sobrescritos cuando ocurre un fallo de escritura recuperable

HPDFExportTypedTablesXLSXFile usa un archivo temporal creado de forma exclusiva junto al destino, lo vuelca a disco y reemplaza atómicamente el destino solo tras una exportación con éxito

HPDFExportLoadedTypedTablesXLSX combina la extracción con la exportación a stream y rechaza un destino que sea alias de la fuente cargada

Cada tabla extraída se convierte en una hoja de trabajo llamada Table N, con celdas numéricas y booleanas, formatos de fecha y de fecha-hora, códigos de moneda en los formatos numéricos, formatos de porcentaje y rangos combinados validados

Los enteros de más de 15 dígitos decimales se almacenan como texto para preservar su valor exacto, porque las celdas numéricas de Excel tienen precisión limitada

Las cadenas permanecen como texto literal, incluidos los valores que empiezan por =, y los caracteres de control XML y las secuencias de escape literales de Office Open XML se preservan mediante el escape de SpreadsheetML

Por defecto, una hoja de trabajo oculta Source metadata registra la dirección de celda del libro, los índices de página y de tabla de origen basados en cero, el texto original y normalizado, el tipo de valor, el código de moneda, los límites en espacio de página y la confianza de cada celda de origen

THPDFXLSXExportOptions.Default permite hasta 4.096 tablas, 1.000.000 filas, 1.000.000 celdas y 256 MiB de salida, con un THPDFCancellationToken opcional y una opción para omitir la hoja de metadatos

La exportación rechaza combinaciones superpuestas, índices de columna desordenados o duplicados, números no finitos, códigos de moneda no válidos, fechas fuera del rango 1900 a 9999, texto de más de 32.767 unidades UTF-16 y hojas de trabajo fuera de los límites de Excel de 1.048.576 filas o 16.384 columnas

La hoja de metadatos tiene una fila de encabezado, de modo que habilitarla limita además las celdas de origen a 1.048.575 en todo el libro; una extracción vacía sigue produciendo una hoja visible

Los miembros ZIP usan el método de compresión stored, por lo que el tamaño de salida puede ser mayor que el de libros comprimidos; el exportador no retiene el estilo visual del PDF ni gráficos, fórmulas, macros ni imágenes incrustadas

Los trabajos JSON y la ABI de C exponen el mismo conducto de libros de trabajo a través de tables.export con format: "xlsx" y los presupuestos compartidos de extracción y salida

APIs relacionadas