SaveDOCXToStream

ドキュメント変換、抽出、DOCX、ストリーム

説明

PDF ページ範囲を編集可能な WordprocessingML 文書に変換し、現在のストリーム位置に DOCX パッケージを書き込む

構文

Function TPDFlib.SaveDOCXToStream(Const PageRange: WideString;
  Options: Integer; Target: TStream): Integer;

パラメータ

PageRange1 から始まるページ範囲です。すべてのページを対象にする場合は空文字列を指定します。明示したページ順は保持されます
Optionsビットマスク: PDF_DOCX_INCLUDE_IMAGES = 1 はページ画像を浮動 PNG オブジェクトとして埋め込み、PDF_DOCX_DETECT_HEADINGS = 2 は大きく短い行を Heading 1 から Heading 3 にマップし、PDF_DOCX_PRESERVE_STYLES = 4 はフォント名、サイズ、色、太字、斜体、上付き文字および下付き文字を保持し、PDF_DOCX_PRESERVE_PAGE_BREAKS = 8 は編集可能な改ページを挿入します。PDF_DOCX_DEFAULT は 4 つすべてを有効にします
Target出力先ストリーム。ライブラリはその所有権を取得しません

戻り値

変換済みページ数を返します。検証、キャンセル、抽出、パッケージ化、書き込みが失敗した場合は 0 を返します

備考

解析では、フォーマット固有の Options とは独立に SetStructuredTextOptions が使われます。読み取りソースとフォールバックの警告は GetLastStructuredTextDiagnostics で確認してください

コンテンツのバインディングが完全であれば、実際のタグツリー順序が優先されます。未解決や曖昧なコンテンツは mixed または geometric へのフォールバックで抽出テキストを保持し、未知のカスタムロールを名前から推測することはありません

読み取り順序の段落、箇条書きと番号付きリスト、テーブルは、ページスナップショットではなくネイティブで編集可能な Word コンテンツになります

空のタグ付きセル、水平スパン、垂直スパンは、ネイティブな Word テーブルセルの w:gridSpan と w:vMerge になります

連結されたテーブル断片はページをまたいでも 1 つの w:tbl に留まり、識別された繰り返しの継続ヘッダーは省略されます。改ページオプションは継続テーブルに編集可能な改ページを挿入します

幾何段組み、余白の装飾要素、継続のマッチング、オプトインの結合推論はヒューリスティックなままです。忠実度が重要な場合は、最新の診断と構造化 JSON の由来を確認してください

ドキュメント全体の解析のため、選択ページのモデルと含まれる画像は保持されます。XML とパッケージの組み立ては追加のバッファを使うため、メモリは選択されたコンテンツと画像に応じて増えます

出力は CRC で検査された raw Deflate エントリを含む決定論的な DOCX ZIP パッケージであり、Office のインストールは不要です

抽出では、選択されたページと開いているライタータグスタックを保持します。未保存の現在のライタータグは、タグを閉じずドキュメントをファイナライズせずにそのまま含まれます

引数が無効な場合、LastErrorCode は 114、抽出、パッケージ化、またはストリーム処理に失敗した場合は 518 です

関連項目

SaveDOCXToFile、ExtractStructuredDocument、ExportDocumentHTML