ExportDocumentMarkdown

텍스트, 추출, Markdown

설명

선택한 PDF 페이지 범위를 검색 인덱싱, 지식 베이스 및 언어 모델 수집에 적합한 의미론적 Markdown 문자열 하나로 내보냅니다

구문

Delphi

Function TPDFlib.ExportDocumentMarkdown(Const PageRange: WideString;
  Options: Integer): WideString;

ActiveX

Function PDFlib::ExportDocumentMarkdown(PageRange As String,
  Options As Long) As String

DLL

const wchar_t* DLExportDocumentMarkdown(int InstanceID,
  const wchar_t* PageRange, int Options);
const char* DLExportDocumentMarkdownA(int InstanceID,
  const char* PageRange, int Options);

매개변수

PageRange1-3,7과 같은 1부터 시작하는 범위이며, 모든 페이지는 빈 문자열로 지정하고 명시한 페이지 순서는 유지됨
OptionsExportPageMarkdown에 설명된 옵션 마스크

반환 값

결합된 Markdown 텍스트를 반환하며 검증, 취소 또는 추출이 실패하면 빈 문자열을 반환합니다

비고

분석은 형식별 Options와 별개로 SetStructuredTextOptions를 사용합니다. 읽기 소스와 폴백 경고는 GetLastStructuredTextDiagnostics에서 확인하십시오

콘텐츠 바인딩이 완전하면 실제 태그 트리 순서가 우선합니다. 해석되지 않거나 모호한 콘텐츠는 mixed 또는 geometric 폴백으로 추출 텍스트를 유지하고, 알 수 없는 사용자 정의 역할은 이름으로 추측하지 않습니다

문서 전역 분석은 연속된 소스 페이지에 걸친 표 조각을 하나로 묶고 반복되는 여백 장식 요소를 식별합니다. 기본 장식 요소 감지는 텍스트를 유지합니다

병합되거나 이어진 표는 하나의 내장 HTML 표가 되고 빈 셀을 유지하며, 식별된 반복 머리글 행은 생략합니다

페이지 마커를 켜면 페이지는 보통 <!-- page: N -->로 시작합니다. 이어지는 표는 열린 HTML 표 안에서는 마커를 넣지 않습니다

명시적인 페이지 순서는 유지됩니다. 뒤집히거나 연속적이지 않은 페이지 선택은 억지로 이어지지 않습니다

선택한 페이지 모델과 전체 Markdown 결과는 문서 전역 분석을 위해 버퍼링됩니다. 스트림과 파일 API도 이 분석 모델과 출력 버퍼를 유지합니다

추출은 선택한 페이지와 열린 라이터 태그 스택을 유지합니다. 아직 저장하지 않은 현재 라이터 태그는 태그를 닫거나 문서를 마무리하지 않고 그대로 포함됩니다

진행률 및 협력적 취소는 일반 문서 작업 수명 주기를 사용합니다

범위 또는 옵션 마스크가 잘못되면 LastErrorCode는 113이고 추출이 실패하면 517입니다

참고 항목

ExportPageMarkdown, SaveMarkdownToStream, ExtractStructuredDocument