SetStructuredTextOptions

Text, Extraktion, Strukturierte Daten

Beschreibung

Setzt die instanzweiten Analyseoptionen für strukturierte JSON-, XHTML-, CSV-, Markdown- und DOCX-Extraktion

Syntax

Delphi

Function TPDFlib.SetStructuredTextOptions(Options: Integer): Integer;

DLL

Function DLSetStructuredTextOptions(InstanceID: Integer; Options: Integer): Integer; Stdcall;

ActiveX

Function PDFlib::SetStructuredTextOptions(Options As Long) As Long

Parameter

Options kombiniert die folgenden Flags; PDF_STRUCTURED_ADVANCED_DEFAULT ist 11 und aktiviert Spaltenerkennung, Seitenelement-Erkennung und Tabellenfortsetzung

KonstanteWertVerhalten
PDF_STRUCTURED_DETECT_COLUMNS1Findet konsistente geometrische Spaltenabstände, wenn die getaggte Reihenfolge nicht verfügbar ist
PDF_STRUCTURED_DETECT_FURNITURE2Erkennt wiederkehrenden Text nahe der Seitenränder über ausgewählte Seiten hinweg, einschließlich Seitenzahlen
PDF_STRUCTURED_EXCLUDE_FURNITURE4Lässt erkannte Kopf- und Fußzeilen, Seitenzahlen und explizite Artefakte aus serialisierten Blöcken weg
PDF_STRUCTURED_JOIN_TABLES8Führt aufeinanderfolgende Seitenfragmente derselben getaggten Tabelle oder geometrisch kompatibler Tabellen nahe gegenüberliegenden Seitenrändern zusammen
PDF_STRUCTURED_INFER_MERGES16Schließt horizontale verbundene Zellen in geometrischen Tabellen her; abgeleitete Verbindungen bewahren Geometrie-Herkunft und Konfidenz

Rückgabewerte

Gibt 1 bei Erfolg oder 0 für eine ungültige Maske zurück; negative Werte und unbekannte Bits werden mit LastErrorCode 111 abgelehnt, und die vorherige Einstellung bleibt erhalten

Anmerkungen

Die Einstellung bleibt auf dieser Instanz dokumentübergreifend erhalten und gilt für nachfolgende Extraktionen; sie ist unabhängig vom formatspezifischen Options-Argument jeder Exportfunktion

Null deaktiviert diese optionalen Analyseschritte und bewahrt dabei die echte Tag-Baum-Reihenfolge, aufgelöste Rollen, Marked-Content-Bindungen, ActualText und getaggte Tabellenzellen

Die Seitenelement-Erkennung bewahrt Text standardmäßig; das Entfernen erfordert das explizite Ausschlussflag, und die Erkennung wiederkehrender Randelemente erfordert mehrere ausgewählte Seiten

Die getaggte Lesereihenfolge folgt der vollständigen gemischten /K-Sequenz, einschließlich Kindelementen und Inhaltsreferenzen; geometrische Spalten sind ein Ausweichweg und werden separat gekennzeichnet

Die Spaltenerkennung unterstützt bis zu acht geometrische Spalten und ist heuristisch; Klassifikation wiederkehrender Randelemente, geometrische Tabellenfortsetzung und abgeleitete Verbindungen können bei ungewöhnlichen Layouts ungenau sein

Getaggte Zellspannen stammen aus Strukturattributen; geometrische Verbindungsableitung ist opt-in und begründet keine semantische Korrektheit

Die Tabellenfortsetzung erfordert Fragmente in Vorwärtsreihenfolge auf aufeinanderfolgenden Quellseiten und kompatible Spaltenraster; umgekehrte, wiederholte oder nicht aufeinanderfolgende Seiten werden nicht erzwungen zusammengeführt

Der Setter löscht den letzten Fehler, bevor die Maske validiert wird

Siehe auch

GetStructuredTextOptions, GetLastStructuredTextDiagnostics, ExtractStructuredDocument, ExportDocumentMarkdown, SaveDOCXToStream