ExportDocumentMarkdown

Texto, extracción, Markdown

Descripción

Exporta un intervalo de páginas PDF seleccionado en una cadena Markdown semántica adecuada para indexación de búsqueda, bases de conocimiento e incorporación a modelos de lenguaje

Sintaxis

Delphi

Function TPDFlib.ExportDocumentMarkdown(Const PageRange: WideString;
  Options: Integer): WideString;

ActiveX

Function PDFlib::ExportDocumentMarkdown(PageRange As String,
  Options As Long) As String

DLL

const wchar_t* DLExportDocumentMarkdown(int InstanceID,
  const wchar_t* PageRange, int Options);
const char* DLExportDocumentMarkdownA(int InstanceID,
  const char* PageRange, int Options);

Parámetros

PageRangeUn intervalo basado en uno como 1-3,7, o una cadena vacía para todas las páginas; se conserva el orden explícito de las páginas
OptionsLa máscara de opciones documentada por ExportPageMarkdown

Valores devueltos

Devuelve el texto Markdown combinado o una cadena vacía cuando falla la validación, la cancelación o la extracción

Observaciones

El análisis usa SetStructuredTextOptions de forma independiente de las Options específicas de formato; examine GetLastStructuredTextDiagnostics para conocer las fuentes de lectura y las advertencias de fallback

El orden real del árbol de etiquetas tiene precedencia cuando las vinculaciones de contenido están completas; el contenido sin resolver o ambiguo conserva el texto extraído en el fallback mixed o geometric, y los roles personalizados desconocidos no se adivinan por su nombre

El análisis de todo el documento puede unir fragmentos de tablas de páginas de origen consecutivas e identificar elementos auxiliares de márgenes repetidos; la detección de elementos auxiliares predeterminada conserva el texto

Las tablas combinadas o continuadas usan una única tabla HTML incrustada, conservan las celdas vacías y omiten los encabezados de continuación repetidos identificados

Con los marcadores de página habilitados, las páginas normalmente comienzan con <!-- page: N -->; una tabla continuada omite los marcadores dentro de la tabla HTML abierta

Se conserva el orden explícito de páginas; las selecciones de páginas invertidas o no consecutivas no se unen de forma forzada

Los modelos de páginas seleccionadas y el resultado Markdown completo se almacenan en búfer para el análisis de todo el documento; las API de flujo y de archivo también retienen este modelo de análisis y los búferes de salida

La extracción conserva la página seleccionada y la pila de etiquetas del escritor abiertas; las etiquetas del escritor aún sin guardar se incluyen sin cerrar etiquetas ni finalizar el documento

El progreso y la cancelación cooperativa usan el ciclo de vida normal de las operaciones del documento

LastErrorCode es 113 para una máscara de rango u opción no válida y 517 cuando falla la extracción

Véase también

ExportPageMarkdown, SaveMarkdownToStream, ExtractStructuredDocument