Typed Table Extraction
THotPDF.ExtractLoadedTypedTables převádí sémantické řádky tabulky na veřejnou kanonickou mřížku sloupců bez úpravy načteného dokumentu
Table continuity
Kompatibilní sousední fragmenty mohou přidat kanonické sloupce, čímž se chybějící mezilehlé začátky změní na explicitní hodnoty ColumnSpan místo zahození sloučených nadpisů
Kompatibilní tabulky na po sobě jdoucích stránkách se stanou jednou tabulkou, zatímco odpovídající vedoucí řádky záhlaví zůstávají přítomné a nesou IsRepeatedHeader
Typed values and confidence
Každá buňka si zachovává původní text Unicode, ohraničení v prostoru stránky, rozpětí řádků a sloupců, normalizovanou hodnotu, typové uložení, kód měny a spolehlivost
Odvození rozpoznává prázdné, řetězcové, celočíselné, číselné, logické, datumové, datum-časové, měnové a procentuální hodnoty podle pravidel desetinných míst, tisíců a pořadí data zvolených volajícím
Bounded export
ExportLoadedTypedTables zapisuje rozšířené řádky CSV ve stylu RFC 4180 nebo JSON bohatý na metadata přes ohraničený stream fáze a finalizaci odolnou vůči vrácení
Limity stránky, glyfu, zdrojové tabulky, výstupní tabulky, řádku, buňky, textu, výstupních bajtů, spolehlivosti a zrušení se kontrolují před publikováním výsledků
Sešity XLSX
Jednotka HPDFXLSXExport exportuje THPDFTypedTables jako sešit Office Open XML, aniž by vyžadovala instalaci Office nebo načítání externí spreadsheet knihovny
HPDFExportTypedTablesXLSX zapisuje do čitelného, zapisovatelného a seekable streamu na jeho aktuální pozici, celý sešit si nejdřív připraví ve staging fázi a při zotavitelné chybě zápisu obnoví přepsané bajty
HPDFExportTypedTablesXLSXFile vytvoří výhradní dočasný soubor vedle cíle, flushne ho a atomicky nahradí cíl až po úspěšném exportu
HPDFExportLoadedTypedTablesXLSX spojuje extrakci se stream exportem a odmítne cíl, který aliasuje načtený zdroj
Každá extrahovaná tabulka se stane worksheetem pojmenovaným Table N, s číselnými a logickými buňkami, formáty data a data-času, kódy měn v number formátech, procentuálními formáty a validovanými sloučenými rozsahy
Celá čísla s více než 15 desítkovými číslicemi se ukládají jako text, aby si zachovala přesnou hodnotu, protože numerické buňky Excelu mají omezenou přesnost
Řetězce zůstávají literálním textem, včetně hodnot začínajících na =, a XML řídicí znaky i literální escape sekvence Office Open XML se zachovají přes escaping SpreadsheetML
Ve výchozím nastavení zaznamenává skrytý worksheet Source metadata adresu buňky v sešitu, zdrojovou stránku a index tabulky od nuly, původní i normalizovaný text, druh hodnoty, kód měny, ohraničení v prostoru stránky a spolehlivost každé zdrojové buňky
THPDFXLSXExportOptions.Default dovolí nejvýše 4 096 tabulek, 1 000 000 řádků, 1 000 000 buněk a 256 MiB výstupu, s volitelným THPDFCancellationToken a volbou, jak metadata worksheet vynechat
Export odmítne překrývající se merges, neuspořádané nebo duplicitní indexy sloupců, nefinite čísla, neplatné kódy měn, data mimo rozsah 1900 až 9999, text delší než 32 767 UTF-16 jednotek a workshopy mimo limity Excelu 1 048 576 řádků a 16 384 sloupců
Metadata sheet má jeden hlavičkový řádek, takže jeho zapnutí navíc omezí zdrojové buňky na 1 048 575 v celém sešitu; prázdná extrakce i tak vytvoří jednu viditelnou sheet
Členové ZIP používají metodu komprese stored, takže výstup může být větší než komprimované sešity; exporter si nenechává žádné vizuální stylování PDF, ani grafy, vzorce, makra nebo vložené obrázky
JSON joby i C ABI vystavují tutéž pipeline sešitů přes tables.export s format: "xlsx" a sdílenými limity extrakce a výstupu