Workflows nativos de Linux para HTML, edición, OCR y archivo
El ABI nativo de callbacks de Linux acepta html.import, text.draw, ocr y pdfa.convert con schemaVersion 1 y los presupuestos existentes de salida, resultados, bytes de trabajo y píxeles
Importación de HTML
{"schemaVersion":1,"type":"html.import","html":"<h1>Invoice</h1><p>Searchable Unicode</p>","createAcroForms":true}
La importación de HTML funciona sobre un handle vacío y usa el engine compartido de layout HTML5/CSS con un canvas nativo de dibujo, matching de Fontconfig, fuentes TrueType Unicode embebidas, shaping con HarfBuzz/FriBidi, recursos PNG/JPEG/BMP/GIF, máscaras de alpha, hyperlinks, paginación y controles AcroForm
El ABI acepta recursos de data inline; no instala un callback de recursos de red ni de archivos, mientras que los llamadores Pascal pueden suministrar el callback de importer existente para recursos explícitos de fuentes, imágenes y stylesheets
Los pageWidth y pageHeight opcionales usan puntos; maxPages y maxLayoutOperations deben ser positivos, y las asignaciones de DOM, CSS, recursos e imágenes también siguen el presupuesto de la operación
Edición de texto de páginas
{"schemaVersion":1,"type":"text.draw","page":0,"text":"Searchable Unicode","left":36,"bottom":36,"right":559,"top":108,"fontFamily":"DejaVu Sans","fontSize":12,"invisible":true}
La inserción preserva los streams originales de la página, incluidos los arrays de contenido referenciados indirectamente, y agrega una apariencia de formulario Unicode embebida con un nombre de recurso privado; el texto invisible usa el modo de rendering 3 y sigue siendo buscable
Las coordenadas son puntos de user-space PDF sin rotación; characterSpacing y wordSpacing usan puntos, y los reemplazos AES-256 autenticados retienen cifrado, contraseñas y permisos
La API Pascal AppendPageText acepta además rotación de apariencia en cuartos de vuelta y ajuste explícito a rectángulos
OCR real
{"schemaVersion":1,"type":"ocr","pages":[0],"language":"eng","dpi":216,"searchLayer":true,"maxMilliseconds":120000}
El OCR renderiza píxeles reales de la página e invoca directamente el ejecutable Tesseract instalado con un vector de argumentos, lee palabras TSV acotadas, valida UTF-8, confidencias y coordenadas de página, y mapea la geometría de página rotada/recortada de vuelta a coordenadas PDF
El resultado incluye palabras por página con text, confidence, left, bottom, right y top; searchLayer false devuelve los datos de reconocimiento, mientras que true también emite un PDF con texto invisible ajustado de fuente embebida
El tesseractPath opcional selecciona un ejecutable explícito; maxWords, minimumConfidence y maxMilliseconds acotan el reconocimiento, y la cancelación o el timeout terminan y recogen el proceso en ejecución
Salida raster nativa PDF/A-4
{"schemaVersion":1,"type":"pdfa.convert","profile":"PDF/A-4","dpi":144}
La conversión raster nativa crea páginas PDF 2.0 frescas sin cifrar con rotación de página horneada, XMP de PDF/A-4, identificadores de documento y un output intent sRGB embebido generado; la aceptación actual incluye validación independiente con veraPDF de cero reglas y checks fallidos
La salida rasteriza el texto y los vectores originales, aplana las apariencias visibles, reemplaza los metadatos de origen y descarta campos interactivos, acciones, adjuntos y firmas; el resultado reporta rasterized, removedFormFields y removedSignatures
Las entradas firmadas exigen allowSignatureInvalidation true explícito; las anotaciones visibles necesitan apariencias normales utilizables antes del flattening, y la preservación nativa de texto/vectores provee un modo de conversión buscable con validación genuina
La reparación explícita de fuentes para archivo embebe los sustitutos disponibles a través de la normalización acotada de Ghostscript, retiene el texto y los vectores buscables, y valida PDF/A-4 antes de la publicación
Publicación y runtimes
Toda la salida binaria se prepara antes de los callbacks; un documento generado o editado reemplaza el handle solo después de que los callbacks de salida y JSON tengan éxito, y los fallos preservan el contexto anterior
El HTML nativo requiere lectores de imágenes de FCL, Fontconfig, fuentes TrueType Unicode instaladas, HarfBuzz y FriBidi; el OCR requiere además Tesseract y datos de lenguaje entrenados, y la generación del perfil de archivo requiere Little CMS 2
Callback ABI · Canvas nativo de dibujo · API Pascal de OCR · API Pascal de archivo
Agrega páginas seleccionadas y valida salida PDF/A-4 que preserva texto/vectores