SetStructuredTextOptions
Text, Extraktion, Strukturierte Daten
Beschreibung
Setzt die instanzweiten Analyseoptionen für strukturierte JSON-, XHTML-, CSV-, Markdown- und DOCX-Extraktion
Syntax
Delphi
Function TPDFlib.SetStructuredTextOptions(Options: Integer): Integer;DLL
Function DLSetStructuredTextOptions(InstanceID: Integer; Options: Integer): Integer; Stdcall;ActiveX
Function PDFlib::SetStructuredTextOptions(Options As Long) As LongParameter
Options kombiniert die folgenden Flags; PDF_STRUCTURED_ADVANCED_DEFAULT ist 11 und aktiviert Spaltenerkennung, Seitenelement-Erkennung und Tabellenfortsetzung
| Konstante | Wert | Verhalten |
|---|---|---|
PDF_STRUCTURED_DETECT_COLUMNS | 1 | Findet konsistente geometrische Spaltenabstände, wenn die getaggte Reihenfolge nicht verfügbar ist |
PDF_STRUCTURED_DETECT_FURNITURE | 2 | Erkennt wiederkehrenden Text nahe der Seitenränder über ausgewählte Seiten hinweg, einschließlich Seitenzahlen |
PDF_STRUCTURED_EXCLUDE_FURNITURE | 4 | Lässt erkannte Kopf- und Fußzeilen, Seitenzahlen und explizite Artefakte aus serialisierten Blöcken weg |
PDF_STRUCTURED_JOIN_TABLES | 8 | Führt aufeinanderfolgende Seitenfragmente derselben getaggten Tabelle oder geometrisch kompatibler Tabellen nahe gegenüberliegenden Seitenrändern zusammen |
PDF_STRUCTURED_INFER_MERGES | 16 | Schließt horizontale verbundene Zellen in geometrischen Tabellen her; abgeleitete Verbindungen bewahren Geometrie-Herkunft und Konfidenz |
Rückgabewerte
Gibt 1 bei Erfolg oder 0 für eine ungültige Maske zurück; negative Werte und unbekannte Bits werden mit LastErrorCode 111 abgelehnt, und die vorherige Einstellung bleibt erhalten
Anmerkungen
Die Einstellung bleibt auf dieser Instanz dokumentübergreifend erhalten und gilt für nachfolgende Extraktionen; sie ist unabhängig vom formatspezifischen Options-Argument jeder Exportfunktion
Null deaktiviert diese optionalen Analyseschritte und bewahrt dabei die echte Tag-Baum-Reihenfolge, aufgelöste Rollen, Marked-Content-Bindungen, ActualText und getaggte Tabellenzellen
Die Seitenelement-Erkennung bewahrt Text standardmäßig; das Entfernen erfordert das explizite Ausschlussflag, und die Erkennung wiederkehrender Randelemente erfordert mehrere ausgewählte Seiten
Die getaggte Lesereihenfolge folgt der vollständigen gemischten /K-Sequenz, einschließlich Kindelementen und Inhaltsreferenzen; geometrische Spalten sind ein Ausweichweg und werden separat gekennzeichnet
Die Spaltenerkennung unterstützt bis zu acht geometrische Spalten und ist heuristisch; Klassifikation wiederkehrender Randelemente, geometrische Tabellenfortsetzung und abgeleitete Verbindungen können bei ungewöhnlichen Layouts ungenau sein
Getaggte Zellspannen stammen aus Strukturattributen; geometrische Verbindungsableitung ist opt-in und begründet keine semantische Korrektheit
Die Tabellenfortsetzung erfordert Fragmente in Vorwärtsreihenfolge auf aufeinanderfolgenden Quellseiten und kompatible Spaltenraster; umgekehrte, wiederholte oder nicht aufeinanderfolgende Seiten werden nicht erzwungen zusammengeführt
Der Setter löscht den letzten Fehler, bevor die Maske validiert wird
Siehe auch
GetStructuredTextOptions, GetLastStructuredTextDiagnostics, ExtractStructuredDocument, ExportDocumentMarkdown, SaveDOCXToStream