SaveDOCXToStream

Conversion de documents, extraction, DOCX, flux

Description

Convertit une plage de pages PDF en document WordprocessingML modifiable et écrit le paquet DOCX à la position actuelle du flux

Syntaxe

Function TPDFlib.SaveDOCXToStream(Const PageRange: WideString;
  Options: Integer; Target: TStream): Integer;

Paramètres

PageRangeUne plage de pages à partir de 1, ou une chaîne vide pour toutes les pages ; l'ordre explicite des pages est conservé
OptionsMasque de bits : PDF_DOCX_INCLUDE_IMAGES = 1 incorpore les images comme PNG flottants, PDF_DOCX_DETECT_HEADINGS = 2 associe les lignes courtes et grandes aux titres 1 à 3, PDF_DOCX_PRESERVE_STYLES = 4 conserve police, taille, couleurs et styles, PDF_DOCX_PRESERVE_PAGE_BREAKS = 8 insère des sauts modifiables ; PDF_DOCX_DEFAULT active les quatre
TargetFlux de destination, qui ne devient pas la propriété de la bibliothèque

Valeurs de retour

Renvoie le nombre de pages converties, ou zéro en cas d'échec de la validation, de l'annulation, de l'extraction, de l'empaquetage ou de l'écriture

Remarques

L’analyse utilise SetStructuredTextOptions indépendamment des Options propres au format ; consultez GetLastStructuredTextDiagnostics pour les sources de lecture et les avertissements de repli

L’ordre réel de l’arbre de balises prime lorsque les liaisons de contenu sont complètes ; un contenu non résolu ou ambigu conserve son texte extrait dans le repli mixed ou geometric, et les rôles personnalisés inconnus ne sont pas devinés d’après leur nom

Les paragraphes dans l'ordre de lecture, les listes à puces et numérotées, ainsi que les tableaux deviennent du contenu Word natif modifiable plutôt que des instantanés de page

Les cellules balisées vides, les étendues horizontales et verticales utilisent les cellules de tableau Word natives, w:gridSpan et w:vMerge

Les fragments de tableaux joints restent dans un seul w:tbl d’une page à l’autre et les en-têtes de continuation répétés identifiés sont omis ; l’option de saut de page insère un saut modifiable dans le tableau poursuivi

Les colonnes géométriques, les habillages de marges, l’appariement des continuations et les fusions déduites optionnelles restent heuristiques ; consultez les derniers diagnostics et la provenance JSON structurée quand la fidélité compte

Les modèles de pages sélectionnées et les images incluses sont conservés pour l’analyse à l’échelle du document ; l’assemblage XML et du paquet utilise des tampons supplémentaires, la mémoire croît donc avec le contenu sélectionné et les images

La sortie est un paquet ZIP DOCX déterministe avec des entrées Deflate brutes vérifiées par CRC et ne nécessite aucune installation d'Office

L’extraction préserve la page sélectionnée et la pile de balises du writer ouverte ; les balises courantes non enregistrées du writer sont incluses sans fermer de balises ni finaliser le document

LastErrorCode vaut 114 pour des arguments non valides et 518 pour un échec d'extraction, d'empaquetage ou de flux

Voir aussi

SaveDOCXToFile, ExtractStructuredDocument, ExportDocumentHTML