ExportDocumentMarkdown
Texto, extracción, Markdown
Descripción
Exporta un intervalo de páginas PDF seleccionado en una cadena Markdown semántica adecuada para indexación de búsqueda, bases de conocimiento e incorporación a modelos de lenguaje
Sintaxis
Delphi
Function TPDFlib.ExportDocumentMarkdown(Const PageRange: WideString;
Options: Integer): WideString;ActiveX
Function PDFlib::ExportDocumentMarkdown(PageRange As String,
Options As Long) As StringDLL
const wchar_t* DLExportDocumentMarkdown(int InstanceID,
const wchar_t* PageRange, int Options);
const char* DLExportDocumentMarkdownA(int InstanceID,
const char* PageRange, int Options);Parámetros
| PageRange | Un intervalo basado en uno como 1-3,7, o una cadena vacía para todas las páginas; se conserva el orden explícito de las páginas |
|---|---|
| Options | La máscara de opciones documentada por ExportPageMarkdown |
Valores devueltos
Devuelve el texto Markdown combinado o una cadena vacía cuando falla la validación, la cancelación o la extracción
Observaciones
El análisis usa SetStructuredTextOptions de forma independiente de las Options específicas de formato; examine GetLastStructuredTextDiagnostics para conocer las fuentes de lectura y las advertencias de fallback
El orden real del árbol de etiquetas tiene precedencia cuando las vinculaciones de contenido están completas; el contenido sin resolver o ambiguo conserva el texto extraído en el fallback mixed o geometric, y los roles personalizados desconocidos no se adivinan por su nombre
El análisis de todo el documento puede unir fragmentos de tablas de páginas de origen consecutivas e identificar elementos auxiliares de márgenes repetidos; la detección de elementos auxiliares predeterminada conserva el texto
Las tablas combinadas o continuadas usan una única tabla HTML incrustada, conservan las celdas vacías y omiten los encabezados de continuación repetidos identificados
Con los marcadores de página habilitados, las páginas normalmente comienzan con <!-- page: N -->; una tabla continuada omite los marcadores dentro de la tabla HTML abierta
Se conserva el orden explícito de páginas; las selecciones de páginas invertidas o no consecutivas no se unen de forma forzada
Los modelos de páginas seleccionadas y el resultado Markdown completo se almacenan en búfer para el análisis de todo el documento; las API de flujo y de archivo también retienen este modelo de análisis y los búferes de salida
La extracción conserva la página seleccionada y la pila de etiquetas del escritor abiertas; las etiquetas del escritor aún sin guardar se incluyen sin cerrar etiquetas ni finalizar el documento
El progreso y la cancelación cooperativa usan el ciclo de vida normal de las operaciones del documento
LastErrorCode es 113 para una máscara de rango u opción no válida y 517 cuando falla la extracción
Véase también
ExportPageMarkdown, SaveMarkdownToStream, ExtractStructuredDocument