SetStructuredTextOptions
Tekst, wyodrębnianie, dane strukturalne
Opis
Ustawia opcje analizy obowiązujące dla całej instancji przy wyodrębnianiu do strukturalnego JSON, XHTML, CSV, Markdown i DOCX
Składnia
Delphi
Function TPDFlib.SetStructuredTextOptions(Options: Integer): Integer;DLL
Function DLSetStructuredTextOptions(InstanceID: Integer; Options: Integer): Integer; Stdcall;ActiveX
Function PDFlib::SetStructuredTextOptions(Options As Long) As LongParametry
Options łączy poniższe flagi; PDF_STRUCTURED_ADVANCED_DEFAULT ma wartość 11 i włącza wykrywanie kolumn, elementów stałych strony oraz łączenie tabel
| Stała | Wartość | Zachowanie |
|---|---|---|
PDF_STRUCTURED_DETECT_COLUMNS | 1 | Znajduje spójne geometryczne przerwy kolumn, gdy otagowana kolejność jest niedostępna |
PDF_STRUCTURED_DETECT_FURNITURE | 2 | Rozpoznaje powtarzający się tekst przy marginesach stron na wybranych stronach, łącznie z numerami stron |
PDF_STRUCTURED_EXCLUDE_FURNITURE | 4 | Pomija rozpoznane nagłówki, stopki, numery stron i jawne artefakty przy serializacji bloków |
PDF_STRUCTURED_JOIN_TABLES | 8 | Kojarzy kolejne fragmenty stron tej samej otagowanej tabeli albo tabele zgodne geometrycznie przy zbieżnych krawędziach stron |
PDF_STRUCTURED_INFER_MERGES | 16 | Wnioskuje poziome scalone komórki w tabelach geometrycznych; wywnioskowane scalenia zachowują pochodzenie geometryczne i pewność |
Wartości zwracane
Zwraca 1 przy sukcesie albo 0 dla nieprawidłowej maski; wartości ujemne i nieznane bity są odrzucane z LastErrorCode 111, a poprzednie ustawienie pozostaje
Uwagi
Ustawienie trwa na tej instancji między dokumentami i dotyczy kolejnych wyodrębbień; jest niezależne od argumentu Options poszczególnych funkcji eksportu, specyficznego dla formatu
Zero wyłącza te opcjonalne kroki analizy, zachowując rzeczywistą kolejność drzewa tagów, rozwiązane role, powiązania marked-content, ActualText i otagowane komórki tabel
Wykrywanie elementów stałych strony domyślnie zachowuje tekst; usunięcie wymaga jawnej flagi wykluczenia, a wykrywanie powtarzających się marginesów wymaga wielu wybranych stron
Otagowana kolejność czytania podąża za pełną mieszaną sekwencją /K, łącznie z elementami potomnymi i odniesieniami do treści; kolumny geometryczne są fallbackiem i są oznaczane osobno
Wykrywanie kolumn obsługuje do ośmiu kolumn geometrycznych i jest heurystyczne; klasyfikacja powtarzających się marginesów, kontynuacja tabel geometrycznych i wnioskowane scalenia mogą być niedokładne dla nietypowych układów
Zakresy komórek otagowanych pochodzą z atrybutów struktury; wnioskowanie scalenia geometrycznego jest włączane jawnie i nie stanowi o poprawności semantycznej
Kontynuacja tabel wymaga fragmentów w kolejności rosnącej na następujących po sobie stronach źródła i zgodnych siatek kolumn; strony odwrócone, powtórzone lub niekolejne nie są łączone na siłę
Setter czyści ostatni błąd przed walidacją maski
Zobacz również
GetStructuredTextOptions, GetLastStructuredTextDiagnostics, ExtractStructuredDocument, ExportDocumentMarkdown, SaveDOCXToStream