ExportDocumentMarkdown

Texto, extração, Markdown

Descrição

Exporta um intervalo de páginas PDF selecionado para uma única string Markdown semântica, adequada para indexação de busca, bases de conhecimento e ingestão por modelos de linguagem

Sintaxe

Delphi

Function TPDFlib.ExportDocumentMarkdown(Const PageRange: WideString;
  Options: Integer): WideString;

ActiveX

Function PDFlib::ExportDocumentMarkdown(PageRange As String,
  Options As Long) As String

DLL

const wchar_t* DLExportDocumentMarkdown(int InstanceID,
  const wchar_t* PageRange, int Options);
const char* DLExportDocumentMarkdownA(int InstanceID,
  const char* PageRange, int Options);

Parâmetros

PageRangeUm intervalo com base 1, como 1-3,7, ou uma string vazia para todas as páginas; a ordem explícita das páginas é preservada
OptionsA máscara de opções documentada em ExportPageMarkdown

Valores retornados

Retorna o texto Markdown combinado, ou uma string vazia quando a validação, o cancelamento ou a extração falham

Observações

A análise usa a SetStructuredTextOptions de forma independente do Options específico de formato; examine a GetLastStructuredTextDiagnostics para origens de leitura e avisos de fallback

A ordem real da árvore de etiquetas tem precedência quando os bindings de conteúdo estão completos; conteúdo não resolvido ou ambíguo retém o texto extraído em fallback mixed ou geometric, e papéis personalizados desconhecidos não são adivinhados pelos nomes deles

A análise de documento inteiro pode juntar fragmentos de tabela de páginas de origem consecutivas e identificar elementos de moldura de margem repetidos; a detecção padrão de elementos de moldura preserva o texto

Tabelas mescladas ou continuadas usam uma única tabela HTML embutida, mantêm células vazias e omitem cabeçalhos de continuação repetidos identificados

Com marcadores de página habilitados, as páginas normalmente começam com <!-- page: N -->; uma tabela continuada omite marcadores dentro da tabela HTML aberta

A ordem explícita de páginas é preservada; seleções de páginas invertidas ou não consecutivas não são unidas à força

Os modelos de páginas selecionados e o resultado Markdown completo são bufferizados para a análise de documento inteiro; as APIs de stream e de arquivo também retêm esse modelo de análise e os buffers de saída

A extração preserva a página selecionada e a pilha de tags do writer aberta; tags do writer não salvas no momento são incluídas sem tags de fechamento nem finalização do documento

Progresso e cancelamento cooperativo usam o ciclo de vida normal de operações de documento

LastErrorCode retorna 113 para intervalo ou máscara de opções inválidos e 517 quando a extração falha

Veja também

ExportPageMarkdown, SaveMarkdownToStream, ExtractStructuredDocument