Typet tabellekstraksjon

THotPDF.ExtractLoadedTypedTables konverterer semantiske tabellrader til et offentlig kanonisk kolonnerutenett uten å endre det lastede dokumentet

Tabellkontinuitet

Kompatible tilstøtende fragmenter kan legge til kanoniske kolonner, slik at manglende mellomliggende starter blir til eksplisitte ColumnSpan-verdier i stedet for at sammenslåtte overskrifter forkastes

Kompatible tabeller på påfølgende sider blir én tabell, mens matchende ledende header-rader forblir til stede og bærer IsRepeatedHeader

Typete verdier og konfidens

Hver celle beholder original Unicode-tekst, bounds i sidekoordinater, rad- og kolonnespenn, normalisert verdi, typet lagring, valutakode og konfidens

Inferensen gjenkjenner tomme verdier, strenger, heltall, tall, boolske verdier, datoer, dato-tider, valutaer og prosentverdier under kaller-valgte regler for desimal, tusenskiller og datorekkefølge

Avgrenset eksport

ExportLoadedTypedTables skriver utvidede RFC 4180-aktige CSV-rader eller metadarik JSON gjennom en avgrenset staging-stream og rollback-sikker endelig publisering

Grenser for sider, glyfer, kildetabeller, output-tabeller, rader, celler, tekst, output-byte, konfidens og kansellering sjekkes før resultatene publiseres

XLSX-arbeidsbøker

Uniten HPDFXLSXExport eksporterer THPDFTypedTables som en Office Open XML-arbeidsbok uten å installere Office eller laste et eksternt regnearkbibliotek

HPDFExportTypedTablesXLSX skriver til en lesbar, skrivbar og søkbar strøm ved dens nåværende posisjon, mellomlagrer den komplette arbeidsboken før publisering og gjenoppretter overskrevne byte når en reparerbar skrivefeil oppstår

HPDFExportTypedTablesXLSXFile bruker en eksklusivt opprettet midlertidig fil ved siden av målet, tømmer den og erstatter målet atomisk først etter vellykket eksport

HPDFExportLoadedTypedTablesXLSX kombinerer ekstraksjon med strømeksport og avviser et mål som aliaser den innlastede kilden

Hver ekstrahert tabell blir et regneark kalt Table N, med numeriske og boolske celler, dato- og dato-tidsformater, valutakoder i tallformater, prosentformater og validerte sammenslåtte områder

Heltall med mer enn 15 desimalsiffer lagres som tekst for å bevare den eksakte verdien, fordi Excels nummerceller har begrenset presisjon

Strenger forblir bokstavelig tekst, inkludert verdier som begynner med =, og XML-kontrolltegn og bokstavelige Office Open XML-escape-sekvenser bevares gjennom SpreadsheetML-escaping

Som standard registrerer et skjult Source metadata-regneark arbeidsbokens celleadresse, nullbaserte kilde-side- og tabellindekser, original og normalisert tekst, verditype, valutakode, grenser i siderom og konfidens for hver kildecelle

THPDFXLSXExportOptions.Default tillater opptil 4 096 tabeller, 1 000 000 rader, 1 000 000 celler og 256 MiB utdata, med en valgfri THPDFCancellationToken og et alternativ for å utelate metadata-regnearket

Eksporten avviser overlappende sammenslåinger, usorterte eller duplikate kolonneindekser, ikke-endelige tall, ugyldige valutakoder, datoer utenfor 1900–9999, tekst lengre enn 32 767 UTF-16-enheter og regneark utenfor Excels grenser på 1 048 576 rader eller 16 384 kolonner

Metadata-arket har én topptekstrad, så aktivering begrenser i tillegg kildecellene til 1 048 575 på tvers av arbeidsboken; en tom ekstraksjon produserer fortsatt ett synlig ark

ZIP-medlemmer bruker den lagrede komprimeringsmetoden, så utdatastørrelsen kan bli større enn for komprimerte arbeidsbøker; eksportøren beholder verken PDF-visuell styling eller diagrammer, formler, makroer eller innebygde bilder

JSON-jobber og C-ABI-en eksponerer samme arbeidsbok-pipeline gjennom tables.export med format: "xlsx" og de felles ekstrasjons- og utdatabudsjettene

Relaterte API-er