Typad tabellextraktion

THotPDF.ExtractLoadedTypedTables konverterar semantiska tabellrader till ett publikt kanoniskt kolumnnät utan att ändra det inlästa dokumentet

Tabellkontinuitet

Kompatibla angränsande fragment kan lägga till kanoniska kolumner, vilket gör missade mellanstarter till explicita ColumnSpan-värden istället för att kasta bort sammanfogade rubriker

Kompatibla tabeller på på varandra följande sidor blir en tabell, medan matchande inledande rubrikrader förblir närvarande och bär IsRepeatedHeader

Typade värden och förtroende

Varje cell behåller ursprunglig Unicode-text, sidrymdsgränser, rad- och kolumnspann, normaliserat värde, typad lagring, valutakod och förtroende

Slutledning känner igen tomma, sträng-, heltal-, tal-, booleska, datum-, datum-tid-, valuta- och procentvärden under anropvalda decimal-, tusentals- och datumordningsregler

Avgränsad export

ExportLoadedTypedTables skriver utvidgade RFC 4180-stil CSV-rader eller metadata-rik JSON genom en avgränsad mellanlagringström och återställningssäker slutlig publicering

Sid-, glyf-, källtabell-, utdatatabell-, rad-, cell-, text-, utdatabyte-, förtroende- och avbrytningsgränser kontrolleras innan resultat publiceras

XLSX-arbetsböcker

Enheten HPDFXLSXExport exporterar THPDFTypedTables som en Office Open XML-arbetsbok utan att installera Office eller läsa in ett externt kalkylarkbibliotek

HPDFExportTypedTablesXLSX skriver till en läsbar, skrivbar och sökbar ström vid dess aktuella position, mellanlagrar hela arbetsboken före publicering och återställer överskrivna byte när ett återhämtningsbart skrivfel inträffar

HPDFExportTypedTablesXLSXFile använder en exklusivt skapad temporärfil bredvid målet, spolar den och ersätter målet atomärt först efter en lyckad export

HPDFExportLoadedTypedTablesXLSX kombinerar extraktion med strömexport och avvisar ett mål som aliasar den inlästa källan

Varje extraherad tabell blir ett kalkylblad med namnet Table N, med numeriska och booleska celler, datum- och datumtidsformat, valutakoder i talformat, procentformat och validerade sammanfogade områden

Heltal med fler än 15 decimaler lagras som text för att bevara sitt exakta värde, eftersom numeriska Excel-celler har begränsad precision

Strängar förblir litteral text, inklusive värden som börjar med =, och XML-styrtecken samt litterala Office Open XML-escape-sekvenser bevaras genom SpreadsheetML-escapning

Som standard registrerar ett dolt Source metadata-kalkylblad arbetsbokens celladress, nollbaserade källsida och tabellindex, ursprunglig och normaliserad text, värdetyp, valutakod, sidrymdsgränser och förtroende för varje källcell

THPDFXLSXExportOptions.Default tillåter upp till 4 096 tabeller, 1 000 000 rader, 1 000 000 celler och 256 MiB utdata, med en valfri THPDFCancellationToken och en möjlighet att utelämna metadatabladet

Exporten avvisar överlappande sammanfogningar, osorterade eller duplicerade kolumnindex, icke-ändliga tal, ogiltiga valutakoder, datum utanför 1900 till 9999, text längre än 32 767 UTF-16-enheter och kalkylblad utanför Excels gränser på 1 048 576 rader eller 16 384 kolumner

Metadatabladet har en rubrikrad, så att det dessutom begränsar källcellerna till 1 048 575 i hela arbetsboken när det är aktiverat; en tom extraktion producerar ändå ett synligt blad

ZIP-medlemmar använder den lagrade komprimeringsmetoden, så utdatastorleken kan bli större än för komprimerade arbetsböcker; exportören behåller varken PDF:ens visuella formatering eller diagram, formler, makron eller inbäddade bilder

JSON-jobb och C-ABI exponerar samma arbetsbokspipeline genom tables.export med format: "xlsx" och de gemensamma extraktions- och utdatabudgeterna

Relaterade API:er