Export structuré de page chargée

THotPDF.ExportLoadedPagesStructured convertit les pages chargées sélectionnées en un document Unicode UTF-8 HTML, XHTML, XML ou JSON sans modifier le PDF

Un modèle sémantique

Chaque format consomme la même géométrie de glyphes et la même analyse d'ordre de lecture sémantique, de sorte que les paragraphes, titres, éléments de liste, légendes, colonnes, ordre de source, lignes de tableau détectées et cellules de tableau restent alignés entre les exportateurs

La génération se termine dans un flux de mise en scène borné, et la publication capture instantanée tous les octets de destination qui seraient écrasés afin qu'un échec d'écriture finale puisse restaurer l'état original du flux

Chaque plage porte un texte Unicode échappé en toute sécurité plus des limites d'espace de page, une ressource de police source et une taille de point facultatives

Chaque span porte du texte Unicode échappé de manière sûre plus des bornes optionnelles en espace page, l’identité de l’objet de flux de contenu source, la ressource de police source et la taille en points

Structure accessible et interactions

HTML et XHTML utilisent des éléments sémantiques et des ancres de pages stables, tandis que XML et JSON retiennent des enregistrements équivalents de début, fin, contenu, référence d’objet, interaction, signet et étiquette de page

Les propriétés de contenu marqué en ligne et nommées sont résolues à travers les flux de pages et les Form XObjects récursifs, ActualText remplace le texte des glyphes visuels, les artefacts restent hors du modèle accessible, et le texte alternatif des figures est associé via le contenu balisé plutôt que l’ordre visuel

Les destinations http, https, mailto et locales sûres peuvent être exportées, tandis que les URI exécutables ou porteurs de caractères de contrôle sont omis

Les noms de champs, libellés, options, états et valeurs ordinaires peuvent être retenus, mais les charges utiles de type mot de passe, sélection de fichier, NoExport et signature ne sont jamais placées dans le modèle d’export partagé

Images

Les occurrences d'images XObjects conservent leur nom de ressource, leur numéro d'objet, leur taille de pixels intrinsèque et leurs limites d'espace de page transformées

simEmbeddedPNG décode chaque image prise en charge via le pipeline d'images borné normal et émet une URI de données PNG, tandis que simMetadataOnly évite la matérialisation de pixels et simOmit exclut les images

Sortie atomique bornée

Les limites de page, de glyphe, de nombre d'images, d'octets d'images, d'images agrégées, d'octets de sortie et d'annulation sont imposées avant que le tampon terminé ne soit copié dans le flux de l'appelant

Les échecs d'extraction et de budget laissent la destination inchangée, tandis qu'un échec d'écriture de destination tente de restaurer sa position et sa taille d'origine

API associée