ExportPageMarkdown

テキスト、抽出、Markdown

説明

ページ's の検出された段落、リスト、見出し、表を使用して、1 つの PDF ページをセマンティック Markdown としてエクスポートする

構文

Delphi

Function TPDFlib.ExportPageMarkdown(Page, Options: Integer): WideString;

ActiveX

Function PDFlib::ExportPageMarkdown(Page As Long, Options As Long) As String

DLL

const wchar_t* DLExportPageMarkdown(int InstanceID, int Page, int Options);
const char* DLExportPageMarkdownA(int InstanceID, int Page, int Options);

パラメータ

Page1 から始まるページ番号
OptionsPDF_MARKDOWN_INCLUDE_PAGE_MARKERS(1)、PDF_MARKDOWN_DETECT_HEADINGS(2)および PDF_MARKDOWN_PRESERVE_STYLES(4)を組み合わせるか、PDF_MARKDOWN_DEFAULT(7)を使用します。ゼロは任意のマーカー、見出し推論またはフォントスタイルなしでセマンティックブロックを出力します

戻り値

Markdown テキストを返します。検証または抽出に失敗した場合は空文字列を返します

備考

解析では、フォーマット固有の Options とは独立に SetStructuredTextOptions が使われます。読み取りソースとフォールバックの警告は GetLastStructuredTextDiagnostics で確認してください

コンテンツのバインディングが完全であれば、実際のタグツリー順序が優先されます。未解決や曖昧なコンテンツは mixed または geometric へのフォールバックで抽出テキストを保持し、未知のカスタムロールを名前から推測することはありません

結合セルのない単純なテーブルはパイプ記法になります。結合セルのあるテーブルは、行と列のスパンを持つ埋め込み HTML になり、空のセルが保持されます

見出しの推定では、短い単一行の段落をページ'の本文テキストサイズの中央値と比較し、H1~H3 のレベルを生成します

PDF_MARKDOWN_PRESERVE_STYLES が有効な場合、フォントスタイルは太字および斜体のフォント名に加えて、上付きおよび下付きの配置も認識します

Markdown 構文文字はエスケープされ、パイプテーブルのセルは埋め込みパイプ文字をエスケープします

抽出では、選択されたページと開いているライタータグスタックを保持します。未保存の現在のライタータグは、タグを閉じずドキュメントをファイナライズせずにそのまま含まれます

DLL の戻りポインターは、同じインスタンスで次に文字列を返す呼び出しを行うまで有効です

LastErrorCode は、ページまたはオプションマスクが無効な場合は 113、抽出に失敗した場合は 517 です

関連項目

ExportDocumentMarkdown、ExtractStructuredPage、ExportPageHTML