Typed Table Extraction

THotPDF.ExtractLoadedTypedTables převádí sémantické řádky tabulky na veřejnou kanonickou mřížku sloupců bez úpravy načteného dokumentu

Table continuity

Kompatibilní sousední fragmenty mohou přidat kanonické sloupce, čímž se chybějící mezilehlé začátky změní na explicitní hodnoty ColumnSpan místo zahození sloučených nadpisů

Kompatibilní tabulky na po sobě jdoucích stránkách se stanou jednou tabulkou, zatímco odpovídající vedoucí řádky záhlaví zůstávají přítomné a nesou IsRepeatedHeader

Typed values and confidence

Každá buňka si zachovává původní text Unicode, ohraničení v prostoru stránky, rozpětí řádků a sloupců, normalizovanou hodnotu, typové uložení, kód měny a spolehlivost

Odvození rozpoznává prázdné, řetězcové, celočíselné, číselné, logické, datumové, datum-časové, měnové a procentuální hodnoty podle pravidel desetinných míst, tisíců a pořadí data zvolených volajícím

Bounded export

ExportLoadedTypedTables zapisuje rozšířené řádky CSV ve stylu RFC 4180 nebo JSON bohatý na metadata přes ohraničený stream fáze a finalizaci odolnou vůči vrácení

Limity stránky, glyfu, zdrojové tabulky, výstupní tabulky, řádku, buňky, textu, výstupních bajtů, spolehlivosti a zrušení se kontrolují před publikováním výsledků

Sešity XLSX

Jednotka HPDFXLSXExport exportuje THPDFTypedTables jako sešit Office Open XML, aniž by vyžadovala instalaci Office nebo načítání externí spreadsheet knihovny

HPDFExportTypedTablesXLSX zapisuje do čitelného, zapisovatelného a seekable streamu na jeho aktuální pozici, celý sešit si nejdřív připraví ve staging fázi a při zotavitelné chybě zápisu obnoví přepsané bajty

HPDFExportTypedTablesXLSXFile vytvoří výhradní dočasný soubor vedle cíle, flushne ho a atomicky nahradí cíl až po úspěšném exportu

HPDFExportLoadedTypedTablesXLSX spojuje extrakci se stream exportem a odmítne cíl, který aliasuje načtený zdroj

Každá extrahovaná tabulka se stane worksheetem pojmenovaným Table N, s číselnými a logickými buňkami, formáty data a data-času, kódy měn v number formátech, procentuálními formáty a validovanými sloučenými rozsahy

Celá čísla s více než 15 desítkovými číslicemi se ukládají jako text, aby si zachovala přesnou hodnotu, protože numerické buňky Excelu mají omezenou přesnost

Řetězce zůstávají literálním textem, včetně hodnot začínajících na =, a XML řídicí znaky i literální escape sekvence Office Open XML se zachovají přes escaping SpreadsheetML

Ve výchozím nastavení zaznamenává skrytý worksheet Source metadata adresu buňky v sešitu, zdrojovou stránku a index tabulky od nuly, původní i normalizovaný text, druh hodnoty, kód měny, ohraničení v prostoru stránky a spolehlivost každé zdrojové buňky

THPDFXLSXExportOptions.Default dovolí nejvýše 4 096 tabulek, 1 000 000 řádků, 1 000 000 buněk a 256 MiB výstupu, s volitelným THPDFCancellationToken a volbou, jak metadata worksheet vynechat

Export odmítne překrývající se merges, neuspořádané nebo duplicitní indexy sloupců, nefinite čísla, neplatné kódy měn, data mimo rozsah 1900 až 9999, text delší než 32 767 UTF-16 jednotek a workshopy mimo limity Excelu 1 048 576 řádků a 16 384 sloupců

Metadata sheet má jeden hlavičkový řádek, takže jeho zapnutí navíc omezí zdrojové buňky na 1 048 575 v celém sešitu; prázdná extrakce i tak vytvoří jednu viditelnou sheet

Členové ZIP používají metodu komprese stored, takže výstup může být větší než komprimované sešity; exporter si nenechává žádné vizuální stylování PDF, ani grafy, vzorce, makra nebo vložené obrázky

JSON joby i C ABI vystavují tutéž pipeline sešitů přes tables.export s format: "xlsx" a sdílenými limity extrakce a výstupu

Související API