Strukturierter Export geladener Seiten
THotPDF.ExportLoadedPagesStructured wandelt ausgewählte geladene Seiten in ein UTF-8-Dokument im Format HTML, XHTML, XML oder JSON um, ohne die PDF zu verändern
Ein semantisches Modell
Jedes Format verwendet dieselbe Glyphengeometrie und semantische Analyse der Lesereihenfolge, sodass Absätze, Überschriften, Listenelemente, Beschriftungen, Spalten, Quellreihenfolge, erkannte Tabellenzeilen und Tabellenzellen zwischen Exportern ausgerichtet bleiben
Die Erzeugung wird in einem begrenzten Staging-Stream abgeschlossen, und die Veröffentlichung sichert alle Zielbytes, die überschrieben würden, damit ein fehlgeschlagener finaler Schreibvorgang den ursprünglichen Streamzustand wiederherstellen kann
Jede Spanne enthält sicher maskierten Unicode-Text sowie optional Begrenzungen im Seitenraum, die Quellschriftressource und die Punktgröße
Jeder Span trägt sicher escapten Unicode-Text plus optionale Begrenzungen im Seitenraum, Objektidentität des Quell-Content-Streams, Schriftressource der Quelle und Punktgröße
Barrierefreie Struktur und Interaktionen
HTML und XHTML nutzen semantische Elemente und stabile Seitenanker; XML und JSON behalten äquivalente Records für begin, end, content, Objektverweise, Interaktionen, Gliederungen und Seitenbezeichnungen
Inline- und benannte Marked-Content-Eigenschaften werden über Seiten-Streams und rekursive Form XObjects aufgelöst; ActualText ersetzt den visuellen Glyphentext, Artefakte bleiben außerhalb des barrierefreien Modells, und Alternativtext für Grafiken wird über getaggten Inhalt statt über die visuelle Reihenfolge zugeordnet
Sichere http-, https- und mailto-Ziele sowie lokale Ziele lassen sich exportieren; ausführbare oder Steuerzeichen enthaltende URIs werden weggelassen
Formularnamen, Beschriftungen, Optionen, States und gewöhnliche Werte können erhalten bleiben; Passwort-, Dateiauswahl-, NoExport- und Signatur-Payloads landen nie im gemeinsamen Exportmodell
Bilder
Vorkommen von Bild-XObjects behalten ihren Ressourcennamen, ihre Objektnummer, ihre intrinsische Pixelgröße und ihre transformierten Begrenzungen im Seitenraum
simEmbeddedPNG dekodiert jedes unterstützte Bild über die normale begrenzte Bildpipeline und erzeugt einen PNG-Daten-URI, während simMetadataOnly die Pixelmaterialisierung vermeidet und simOmit Bilder ausschließt
Begrenzte atomare Ausgabe
Grenzen für Seiten, Glyphen, Bildanzahl, Bildbytes, aggregierte Bilder, Ausgabebytes und Abbruch werden durchgesetzt, bevor der vollständige Puffer in den Aufruferstream kopiert wird
Extraktions- und Budgetfehler lassen das Ziel unverändert, während ein Fehler beim Schreiben in das Ziel versucht, dessen ursprüngliche Position und Größe wiederherzustellen