ExportDocumentMarkdown

文字、擷取、Markdown

描述

將所選 PDF 頁面範圍匯出成單一語義化 Markdown 字串,適合搜尋索引、知識庫與語言模型攝取

語法

Delphi

Function TPDFlib.ExportDocumentMarkdown(Const PageRange: WideString;
  Options: Integer): WideString;

ActiveX

Function PDFlib::ExportDocumentMarkdown(PageRange As String,
  Options As Long) As String

DLL

const wchar_t* DLExportDocumentMarkdown(int InstanceID,
  const wchar_t* PageRange, int Options);
const char* DLExportDocumentMarkdownA(int InstanceID,
  const char* PageRange, int Options);

參數

PageRange以 1 起算的範圍,例如 1-3,7;空字串表示所有頁面;明確指定的頁序會保留
OptionsExportPageMarkdown 記載的選項遮罩

傳回值

傳回合併後的 Markdown 文字;驗證、取消或擷取失敗時傳回空字串

備註

分析使用 SetStructuredTextOptions,與各格式專屬的 Options 分開;讀取來源與後備警告請看 GetLastStructuredTextDiagnostics

內容繫結完整時,真實標籤樹順序優先;未解析或不明確的內容會以 mixed 或 geometric 後備保留萃取文字,未知自訂角色不會從名稱猜測

文件層級分析可以合併跨連續來源頁面的表格片段,並辨識重複出現在頁面邊界的附屬元素;預設的附屬元素偵測會保留其文字

合併或接續的表格使用單一內嵌 HTML 表格、保留空白儲存格,並省略已辨識的重複接續表頭

啟用頁面標記時,頁面通常以 <!-- page: N --> 開頭;接續中的表格在開啟的 HTML 表格內會省略標記

明確指定的頁面順序會保留;反向或不連續的頁面選擇不會被強制合併

所選頁面模型與完整 Markdown 結果會為文件層級分析緩衝;串流與檔案 API 也會保留這份分析模型與輸出緩衝

擷取會保留所選頁面與開啟中的寫入器標籤堆疊;目前未儲存的寫入器標籤會在不關閉標籤、不結束文件的狀態下納入輸出

進度與合作式取消走一般文件操作生命週期

LastErrorCode 為 113 表示範圍或選項遮罩無效,517 表示萃取失敗

另請參閱

ExportPageMarkdown, SaveMarkdownToStream, ExtractStructuredDocument