Ekstrakcja tabel typowanych

THotPDF.ExtractLoadedTypedTables przekształca semantyczne wiersze tabel w publiczną kanoniczną siatkę kolumn bez modyfikowania załadowanego dokumentu

Ciągłość tabel

Zgodne przyległe fragmenty mogą dodawać kanoniczne kolumny, zamieniając brakujące pośrednie początki na jawne wartości ColumnSpan zamiast odrzucać scalone nagłówki

Zgodne tabele na kolejnych stronach stają się jedną tabelą, a pasujące wiodące wiersze nagłówkowe pozostają obecne i niosą IsRepeatedHeader

Wartości typowane i pewność

Każda komórka zachowuje oryginalny tekst Unicode, granice w przestrzeni strony, rozpiętości wierszy i kolumn, znormalizowaną wartość, typowany magazyn, kod waluty i pewność

Inferencja rozpoznaje wartości puste, łańcuchowe, całkowite, liczbowe, boolowskie, daty, daty z czasem, walutowe i procentowe według reguł miejsc dziesiętnych, separatorów tysięcy i kolejności dat wybranych przez wywołującego

Ograniczony eksport

ExportLoadedTypedTables zapisuje rozwinięte wiersze CSV w stylu RFC 4180 albo JSON bogaty w metadane przez ograniczony strumień etapowy i publikację końcową bezpieczną dla wycofania

Limity stron, glifów, tabel źródłowych, tabel wyjściowych, wierszy, komórek, tekstu, bajtów wyjściowych, pewności i anulowania są sprawdzane przed publikacją wyników

Skoroszyty XLSX

Jednostka HPDFXLSXExport eksportuje THPDFTypedTables jako skoroszyt Office Open XML bez instalowania Office ani ładowania zewnętrznej biblioteki arkuszy

HPDFExportTypedTablesXLSX zapisuje do czytelnego, zapisywalnego, przeszukiwalnego strumienia od jego bieżącej pozycji, etapuje cały skoroszyt przed publikacją i przywraca nadpisane bajty, gdy odwracalny zapis się nie powiedzie

HPDFExportTypedTablesXLSXFile używa ekskluzywnie utworzonego pliku tymczasowego obok celu, opróżnia go i atomowo zastępuje cel dopiero po udanym eksporcie

HPDFExportLoadedTypedTablesXLSX łączy ekstrakcję z eksportem strumieniowym i odrzuca cel będący aliasem załadowanego źródła

Każda wyekstrahowana tabela staje się arkuszem o nazwie Table N, z komórkami numerycznymi i boolowskimi, formatami daty i daty z czasem, kodami walut w formatach liczbowych, formatami procentowymi i zwalidowanymi scalonymi zakresami

Liczby całkowite o więcej niż 15 cyfrach dziesiętnych są zapisywane jako tekst, by zachować ich dokładną wartość, bo komórki numeryczne Excela mają ograniczoną precyzję

Łańcuchy pozostają tekstem literalnym, w tym wartości zaczynające się od =, a znaki kontrolne XML i literał sekwencji ucieczki Office Open XML są zachowywane przez escapowanie SpreadsheetML

Domyślnie ukryty arkusz Source metadata rejestruje adres komórki w skoroszycie, zerowe indeksy strony i tabeli źródłowej, tekst oryginalny i znormalizowany, rodzaj wartości, kod waluty, granice w przestrzeni strony i pewność dla każdej komórki źródłowej

THPDFXLSXExportOptions.Default dopuszcza do 4 096 tabel, 1 000 000 wierszy, 1 000 000 komórek i 256 MiB wyjścia, z opcjonalnym THPDFCancellationToken i opcją pominięcia arkusza metadanych

Eksport odrzuca nakładające się scalenia, nieuporządkowane lub zduplikowane indeksy kolumn, liczby nieskończone, nieprawidłowe kody walut, daty poza zakresem 1900-9999, tekst dłuższy niż 32 767 jednostek UTF-16 oraz arkusze poza limitami Excela: 1 048 576 wierszy albo 16 384 kolumn

Arkusza metadanych ma jeden wiersz nagłówkowy, więc jej włączenie dodatkowo ogranicza komórki źródłowe do 1 048 575 w całym skoroszycie; pusta ekstrakcja i tak daje jeden widoczny arkusz

Elementy ZIP używają metody kompresji stored, więc rozmiar wyjścia może być większy niż w skoroszytach kompresowanych; eksporter nie zachowuje ani stylowania wizualnego PDF, ani wykresów, formuł, makr i osadzonych obrazów

Zadania JSON i C ABI wystawiają ten sam potok skoroszytu przez tables.export z format: "xlsx" i współdzielonymi budżetami ekstrakcji i wyjścia

Powiązane API