Export structuré de page chargée
THotPDF.ExportLoadedPagesStructured convertit les pages chargées sélectionnées en un document Unicode UTF-8 HTML, XHTML, XML ou JSON sans modifier le PDF
Un modèle sémantique
Chaque format consomme la même géométrie de glyphes et la même analyse d'ordre de lecture sémantique, de sorte que les paragraphes, titres, éléments de liste, légendes, colonnes, ordre de source, lignes de tableau détectées et cellules de tableau restent alignés entre les exportateurs
La génération se termine dans un flux de mise en scène borné, et la publication capture instantanée tous les octets de destination qui seraient écrasés afin qu'un échec d'écriture finale puisse restaurer l'état original du flux
Chaque plage porte un texte Unicode échappé en toute sécurité plus des limites d'espace de page, une ressource de police source et une taille de point facultatives
Chaque span porte du texte Unicode échappé de manière sûre plus des bornes optionnelles en espace page, l’identité de l’objet de flux de contenu source, la ressource de police source et la taille en points
Structure accessible et interactions
HTML et XHTML utilisent des éléments sémantiques et des ancres de pages stables, tandis que XML et JSON retiennent des enregistrements équivalents de début, fin, contenu, référence d’objet, interaction, signet et étiquette de page
Les propriétés de contenu marqué en ligne et nommées sont résolues à travers les flux de pages et les Form XObjects récursifs, ActualText remplace le texte des glyphes visuels, les artefacts restent hors du modèle accessible, et le texte alternatif des figures est associé via le contenu balisé plutôt que l’ordre visuel
Les destinations http, https, mailto et locales sûres peuvent être exportées, tandis que les URI exécutables ou porteurs de caractères de contrôle sont omis
Les noms de champs, libellés, options, états et valeurs ordinaires peuvent être retenus, mais les charges utiles de type mot de passe, sélection de fichier, NoExport et signature ne sont jamais placées dans le modèle d’export partagé
Images
Les occurrences d'images XObjects conservent leur nom de ressource, leur numéro d'objet, leur taille de pixels intrinsèque et leurs limites d'espace de page transformées
simEmbeddedPNG décode chaque image prise en charge via le pipeline d'images borné normal et émet une URI de données PNG, tandis que simMetadataOnly évite la matérialisation de pixels et simOmit exclut les images
Sortie atomique bornée
Les limites de page, de glyphe, de nombre d'images, d'octets d'images, d'images agrégées, d'octets de sortie et d'annulation sont imposées avant que le tampon terminé ne soit copié dans le flux de l'appelant
Les échecs d'extraction et de budget laissent la destination inchangée, tandis qu'un échec d'écriture de destination tente de restaurer sa position et sa taille d'origine