ExportDocumentMarkdown
Texto, extração, Markdown
Descrição
Exporta um intervalo de páginas PDF selecionado para uma única string Markdown semântica, adequada para indexação de busca, bases de conhecimento e ingestão por modelos de linguagem
Sintaxe
Delphi
Function TPDFlib.ExportDocumentMarkdown(Const PageRange: WideString;
Options: Integer): WideString;ActiveX
Function PDFlib::ExportDocumentMarkdown(PageRange As String,
Options As Long) As StringDLL
const wchar_t* DLExportDocumentMarkdown(int InstanceID,
const wchar_t* PageRange, int Options);
const char* DLExportDocumentMarkdownA(int InstanceID,
const char* PageRange, int Options);Parâmetros
| PageRange | Um intervalo com base 1, como 1-3,7, ou uma string vazia para todas as páginas; a ordem explícita das páginas é preservada |
|---|---|
| Options | A máscara de opções documentada em ExportPageMarkdown |
Valores retornados
Retorna o texto Markdown combinado, ou uma string vazia quando a validação, o cancelamento ou a extração falham
Observações
A análise usa a SetStructuredTextOptions de forma independente do Options específico de formato; examine a GetLastStructuredTextDiagnostics para origens de leitura e avisos de fallback
A ordem real da árvore de etiquetas tem precedência quando os bindings de conteúdo estão completos; conteúdo não resolvido ou ambíguo retém o texto extraído em fallback mixed ou geometric, e papéis personalizados desconhecidos não são adivinhados pelos nomes deles
A análise de documento inteiro pode juntar fragmentos de tabela de páginas de origem consecutivas e identificar elementos de moldura de margem repetidos; a detecção padrão de elementos de moldura preserva o texto
Tabelas mescladas ou continuadas usam uma única tabela HTML embutida, mantêm células vazias e omitem cabeçalhos de continuação repetidos identificados
Com marcadores de página habilitados, as páginas normalmente começam com <!-- page: N -->; uma tabela continuada omite marcadores dentro da tabela HTML aberta
A ordem explícita de páginas é preservada; seleções de páginas invertidas ou não consecutivas não são unidas à força
Os modelos de páginas selecionados e o resultado Markdown completo são bufferizados para a análise de documento inteiro; as APIs de stream e de arquivo também retêm esse modelo de análise e os buffers de saída
A extração preserva a página selecionada e a pilha de tags do writer aberta; tags do writer não salvas no momento são incluídas sem tags de fechamento nem finalização do documento
Progresso e cancelamento cooperativo usam o ciclo de vida normal de operações de documento
LastErrorCode retorna 113 para intervalo ou máscara de opções inválidos e 517 quando a extração falha
Veja também
ExportPageMarkdown, SaveMarkdownToStream, ExtractStructuredDocument