Ekstrakcja tabel typowanych
THotPDF.ExtractLoadedTypedTables przekształca semantyczne wiersze tabel w publiczną kanoniczną siatkę kolumn bez modyfikowania załadowanego dokumentu
Ciągłość tabel
Zgodne przyległe fragmenty mogą dodawać kanoniczne kolumny, zamieniając brakujące pośrednie początki na jawne wartości ColumnSpan zamiast odrzucać scalone nagłówki
Zgodne tabele na kolejnych stronach stają się jedną tabelą, a pasujące wiodące wiersze nagłówkowe pozostają obecne i niosą IsRepeatedHeader
Wartości typowane i pewność
Każda komórka zachowuje oryginalny tekst Unicode, granice w przestrzeni strony, rozpiętości wierszy i kolumn, znormalizowaną wartość, typowany magazyn, kod waluty i pewność
Inferencja rozpoznaje wartości puste, łańcuchowe, całkowite, liczbowe, boolowskie, daty, daty z czasem, walutowe i procentowe według reguł miejsc dziesiętnych, separatorów tysięcy i kolejności dat wybranych przez wywołującego
Ograniczony eksport
ExportLoadedTypedTables zapisuje rozwinięte wiersze CSV w stylu RFC 4180 albo JSON bogaty w metadane przez ograniczony strumień etapowy i publikację końcową bezpieczną dla wycofania
Limity stron, glifów, tabel źródłowych, tabel wyjściowych, wierszy, komórek, tekstu, bajtów wyjściowych, pewności i anulowania są sprawdzane przed publikacją wyników
Skoroszyty XLSX
Jednostka HPDFXLSXExport eksportuje THPDFTypedTables jako skoroszyt Office Open XML bez instalowania Office ani ładowania zewnętrznej biblioteki arkuszy
HPDFExportTypedTablesXLSX zapisuje do czytelnego, zapisywalnego, przeszukiwalnego strumienia od jego bieżącej pozycji, etapuje cały skoroszyt przed publikacją i przywraca nadpisane bajty, gdy odwracalny zapis się nie powiedzie
HPDFExportTypedTablesXLSXFile używa ekskluzywnie utworzonego pliku tymczasowego obok celu, opróżnia go i atomowo zastępuje cel dopiero po udanym eksporcie
HPDFExportLoadedTypedTablesXLSX łączy ekstrakcję z eksportem strumieniowym i odrzuca cel będący aliasem załadowanego źródła
Każda wyekstrahowana tabela staje się arkuszem o nazwie Table N, z komórkami numerycznymi i boolowskimi, formatami daty i daty z czasem, kodami walut w formatach liczbowych, formatami procentowymi i zwalidowanymi scalonymi zakresami
Liczby całkowite o więcej niż 15 cyfrach dziesiętnych są zapisywane jako tekst, by zachować ich dokładną wartość, bo komórki numeryczne Excela mają ograniczoną precyzję
Łańcuchy pozostają tekstem literalnym, w tym wartości zaczynające się od =, a znaki kontrolne XML i literał sekwencji ucieczki Office Open XML są zachowywane przez escapowanie SpreadsheetML
Domyślnie ukryty arkusz Source metadata rejestruje adres komórki w skoroszycie, zerowe indeksy strony i tabeli źródłowej, tekst oryginalny i znormalizowany, rodzaj wartości, kod waluty, granice w przestrzeni strony i pewność dla każdej komórki źródłowej
THPDFXLSXExportOptions.Default dopuszcza do 4 096 tabel, 1 000 000 wierszy, 1 000 000 komórek i 256 MiB wyjścia, z opcjonalnym THPDFCancellationToken i opcją pominięcia arkusza metadanych
Eksport odrzuca nakładające się scalenia, nieuporządkowane lub zduplikowane indeksy kolumn, liczby nieskończone, nieprawidłowe kody walut, daty poza zakresem 1900-9999, tekst dłuższy niż 32 767 jednostek UTF-16 oraz arkusze poza limitami Excela: 1 048 576 wierszy albo 16 384 kolumn
Arkusza metadanych ma jeden wiersz nagłówkowy, więc jej włączenie dodatkowo ogranicza komórki źródłowe do 1 048 575 w całym skoroszycie; pusta ekstrakcja i tak daje jeden widoczny arkusz
Elementy ZIP używają metody kompresji stored, więc rozmiar wyjścia może być większy niż w skoroszytach kompresowanych; eksporter nie zachowuje ani stylowania wizualnego PDF, ani wykresów, formuł, makr i osadzonych obrazów
Zadania JSON i C ABI wystawiają ten sam potok skoroszytu przez tables.export z format: "xlsx" i współdzielonymi budżetami ekstrakcji i wyjścia