Extração de tabelas tipadas
THotPDF.ExtractLoadedTypedTables converte linhas de tabelas semânticas em uma grade canônica pública de colunas sem modificar o documento carregado
Continuidade de tabelas
Fragmentos adjacentes compatíveis podem adicionar colunas canônicas, transformando inícios intermediários ausentes em valores explícitos de ColumnSpan em vez de descartar cabeçalhos mesclados
Tabelas compatíveis em páginas consecutivas tornam-se uma única tabela, enquanto linhas de cabeçalho iniciais correspondentes permanecem presentes e carregam IsRepeatedHeader
Valores tipados e confiança
Cada célula retém o texto Unicode original, os limites no espaço da página, os intervalos de linha e coluna, o valor normalizado, o armazenamento tipado, o código de moeda e a confiança
A inferência reconhece valores vazios, de string, inteiro, número, booleano, data, data-hora, moeda e porcentagem sob regras de decimal, milhares e ordem de data selecionadas pelo chamador
Exportação limitada
ExportLoadedTypedTables grava linhas CSV expandidas no estilo RFC 4180 ou JSON rico em metadados por meio de um stream de preparação limitado e publicação final segura quanto a rollback
Limites de página, glifo, tabela de origem, tabela de saída, linha, célula, texto, byte de saída, confiança e cancelamento são verificados antes de publicar os resultados
Pastas de trabalho XLSX
A unidade HPDFXLSXExport exporta THPDFTypedTables como uma pasta de trabalho Office Open XML sem instalar o Office nem carregar uma biblioteca de planilhas externa
HPDFExportTypedTablesXLSX grava em um stream legível, gravável e com seek, na posição atual dele, preparando a pasta de trabalho completa antes da publicação e restaurando os bytes sobrescritos quando ocorre uma falha de gravação recuperável
HPDFExportTypedTablesXLSXFile usa um arquivo temporário criado com exclusividade ao lado do alvo, faz flush dele e substitui atomicamente o alvo somente após a exportação bem-sucedida
HPDFExportLoadedTypedTablesXLSX combina a extração com a exportação por stream e rejeita um destino que seja alias da fonte carregada
Cada tabela extraída vira uma worksheet chamada Table N, com células numéricas e booleanas, formatos de data e data-hora, códigos de moeda nos formatos numéricos, formatos de porcentagem e intervalos mesclados validados
Inteiros com mais de 15 dígitos decimais são armazenados como texto para preservar o valor exato, porque células numéricas do Excel têm precisão limitada
Strings permanecem texto literal, incluindo valores que começam com =, e caracteres de controle XML e sequências de escape literais do Office Open XML são preservados por meio do escaping do SpreadsheetML
Por padrão, uma worksheet oculta Source metadata registra o endereço de célula na pasta de trabalho, os índices de página e de tabela de origem com base zero, o texto original e normalizado, o tipo de valor, o código de moeda, os limites no espaço da página e a confiança de cada célula de origem
THPDFXLSXExportOptions.Default permite até 4.096 tabelas, 1.000.000 de linhas, 1.000.000 de células e 256 MiB de saída, com um THPDFCancellationToken opcional e uma opção para omitir a worksheet de metadados
A exportação rejeita mesclagens sobrepostas, índices de coluna fora de ordem ou duplicados, números não finitos, códigos de moeda inválidos, datas fora do intervalo de 1900 a 9999, texto com mais de 32.767 unidades UTF-16 e worksheets fora dos limites de 1.048.576 linhas ou 16.384 colunas do Excel
A planilha de metadados tem uma linha de cabeçalho, então habilitá-la limita adicionalmente as células de origem a 1.048.575 em toda a pasta de trabalho; uma extração vazia ainda produz uma planilha visível
Membros ZIP usam o método de compressão stored, então o tamanho da saída pode ficar maior que o de pastas de trabalho comprimidas; o exportador não retém o estilo visual do PDF nem charts, fórmulas, macros ou imagens embutidas
Jobs JSON e a C ABI expõem o mesmo pipeline de pasta de trabalho por meio de tables.export com format: "xlsx" e os orçamentos compartilhados de extração e saída