SetStructuredTextOptions

Tekst, wyodrębnianie, dane strukturalne

Opis

Ustawia opcje analizy obowiązujące dla całej instancji przy wyodrębnianiu do strukturalnego JSON, XHTML, CSV, Markdown i DOCX

Składnia

Delphi

Function TPDFlib.SetStructuredTextOptions(Options: Integer): Integer;

DLL

Function DLSetStructuredTextOptions(InstanceID: Integer; Options: Integer): Integer; Stdcall;

ActiveX

Function PDFlib::SetStructuredTextOptions(Options As Long) As Long

Parametry

Options łączy poniższe flagi; PDF_STRUCTURED_ADVANCED_DEFAULT ma wartość 11 i włącza wykrywanie kolumn, elementów stałych strony oraz łączenie tabel

StałaWartośćZachowanie
PDF_STRUCTURED_DETECT_COLUMNS1Znajduje spójne geometryczne przerwy kolumn, gdy otagowana kolejność jest niedostępna
PDF_STRUCTURED_DETECT_FURNITURE2Rozpoznaje powtarzający się tekst przy marginesach stron na wybranych stronach, łącznie z numerami stron
PDF_STRUCTURED_EXCLUDE_FURNITURE4Pomija rozpoznane nagłówki, stopki, numery stron i jawne artefakty przy serializacji bloków
PDF_STRUCTURED_JOIN_TABLES8Kojarzy kolejne fragmenty stron tej samej otagowanej tabeli albo tabele zgodne geometrycznie przy zbieżnych krawędziach stron
PDF_STRUCTURED_INFER_MERGES16Wnioskuje poziome scalone komórki w tabelach geometrycznych; wywnioskowane scalenia zachowują pochodzenie geometryczne i pewność

Wartości zwracane

Zwraca 1 przy sukcesie albo 0 dla nieprawidłowej maski; wartości ujemne i nieznane bity są odrzucane z LastErrorCode 111, a poprzednie ustawienie pozostaje

Uwagi

Ustawienie trwa na tej instancji między dokumentami i dotyczy kolejnych wyodrębbień; jest niezależne od argumentu Options poszczególnych funkcji eksportu, specyficznego dla formatu

Zero wyłącza te opcjonalne kroki analizy, zachowując rzeczywistą kolejność drzewa tagów, rozwiązane role, powiązania marked-content, ActualText i otagowane komórki tabel

Wykrywanie elementów stałych strony domyślnie zachowuje tekst; usunięcie wymaga jawnej flagi wykluczenia, a wykrywanie powtarzających się marginesów wymaga wielu wybranych stron

Otagowana kolejność czytania podąża za pełną mieszaną sekwencją /K, łącznie z elementami potomnymi i odniesieniami do treści; kolumny geometryczne są fallbackiem i są oznaczane osobno

Wykrywanie kolumn obsługuje do ośmiu kolumn geometrycznych i jest heurystyczne; klasyfikacja powtarzających się marginesów, kontynuacja tabel geometrycznych i wnioskowane scalenia mogą być niedokładne dla nietypowych układów

Zakresy komórek otagowanych pochodzą z atrybutów struktury; wnioskowanie scalenia geometrycznego jest włączane jawnie i nie stanowi o poprawności semantycznej

Kontynuacja tabel wymaga fragmentów w kolejności rosnącej na następujących po sobie stronach źródła i zgodnych siatek kolumn; strony odwrócone, powtórzone lub niekolejne nie są łączone na siłę

Setter czyści ostatni błąd przed walidacją maski

Zobacz również

GetStructuredTextOptions, GetLastStructuredTextDiagnostics, ExtractStructuredDocument, ExportDocumentMarkdown, SaveDOCXToStream