Configurador de Docling

Elige tus opciones para generar un comando CLI ejecutable y un fragmento equivalente en Python. Los flags siguen la sintaxis actual docling convert; verifícalos en la documentación oficial.

  1. 1ConfigureChoose your options
  2. 2Preview & copyCLI + Python snippet
  3. 3Run locallyPaste or download the script
Input

PDF unlocks the OCR and table options below; other formats use their own backend automatically.

OCR & tables
Activar motor OCR

Disabling OCR speeds up digital PDFs — keep it on for scans and photos.

Enrichment
Enriquecer bloques de código
Enriquecer fórmulas LaTeX
Extraer datos de gráficos

Each option adds a model pass — enable only what your document contains.

Output & performance

Auto selects CUDA → MPS → CPU; tune threads to your machine.

Comando CLI

bash

Equivalente en Python

python
1
Paso 1

Cómo usar el generador

El generador convierte tus selecciones en un comando docling convert listo para copiar y en un fragmento de Python equivalente. Esta guía explica qué hace cada opción, cómo se asignan los flags generados a la API de Python y cómo ejecutar el resultado de forma segura.

Trabaja de arriba hacia abajo; la vista previa se actualiza al cambiar cualquier control.

  1. Elige el formato de entrada que coincida con tu archivo. Solo cambia el tratamiento de entrada para PDF; los demás formatos usan su propio backend.
  2. Decide sobre el OCR Déjalo activado para escaneos y fotos, y desactívalo para PDF digitales para convertir mucho más rápido.
  3. Elige motor y modo de OCR si el OCR está activo. Empieza con auto y elige un motor concreto solo cuando lo necesites.
  4. Selecciona el modo de tablas accurate para tablas complejas y fast cuando la velocidad importa más que la precisión.
  5. Activa solo el enriquecimiento necesario Código, fórmulas y gráficos añaden procesamiento neuronal adicional.
  6. Elige el formato de salida y el acelerador Markdown para leer, JSON para estructura; usa GPU solo si tienes una.
  7. Copia o descarga el script Usa Copiar CLI, Copiar Python o Descargar script (.sh).
  8. Ejecuta y revisa la salida El archivo convertido se escribe junto al original de forma predeterminada.
2
Paso 2

Formato de entrada

Elige la opción más cercana. Solo las entradas PDF e imagen se ven afectadas por las opciones de OCR y tablas; el resto se procesa automáticamente con su backend específico.

EntradaExtensionesOCR aplicaNotas
PDF.pdfSí (opcional)Diseño, orden de lectura y tablas: el caso principal de esta herramienta.
Word.docx, .docNoSe conservan títulos, listas y tablas.
PowerPoint.pptxNoDiapositivas, cuadros de texto y notas.
Excel.xlsxNoCada hoja se convierte en una tabla estructurada.
HTML.html, .htmNoPáginas web y HTML guardado.
Audio.mp3, .wavNoUsa el pipeline ASR; las opciones de OCR no aplican.
3
Paso 3

Opciones de OCR

El OCR convierte el texto de las imágenes en texto legible por máquina. Es el mayor factor en precisión y tiempo de ejecución, así que actívalo con criterio.

  • Activa el OCR cuando el documento sea un escaneo, una foto o un PDF sin capa de texto seleccionable.
  • Desactiva el OCR en PDF digitales: puede acelerar la conversión varias veces (--no-ocr).
  • El modo default conserva el texto existente y solo aplica OCR a las páginas sin texto.
  • El modo full_page aplica OCR a todas las páginas y sobrescribe el texto detectado.
MotorPlataformaIdeal paraNotas
autoTodasDejar que Docling elijaPredeterminado y el punto de partida más seguro.
RapidOCRMultiplataformaOCR multilingüe apto para CPUBasado en ONNX; sin dependencias pesadas.
Tesseract (tesserocr)Multiplataforma (binario del sistema)OCR maduro con muchos idiomasRequiere Tesseract y datos de idioma instalados.
EasyOCRMultiplataformaInstalación sencillaDescarga sus propios modelos en el primer uso.
OcrMacSolo macOSOCR nativo de Apple VisionSolo disponible en macOS.
Nemotron OCRLinux + CUDAOCR acelerado por GPURequiere un entorno CUDA compatible.
4
Paso 4

Extracción de tablas

Las tablas se reconstruyen a partir del diseño, no del texto sin procesar, así que el modo elegido cambia la calidad del resultado.

ModoModeloPrecisiónVelocidadÚsalo cuando
accurateTableFormerAltaMás lentoCeldas combinadas, tablas sin bordes e informes financieros.
fastModelo de estructura rápidoAproximadaMás rápidoSolo necesitas una tabla aproximada y prima la velocidad.
5
Paso 5

Enriquecimiento

El enriquecimiento añade posprocesado neuronal para detectar contenido especializado. Actívalo solo cuando el documento realmente lo contenga.

OpciónExtraeCuándo activarCoste
--enrich-codeBloques de códigoDocumentos técnicos y de desarrollo.Paso de modelo adicional
--enrich-formulaFórmulas LaTeXPDF científicos y académicos.Paso de modelo adicional
--enrich-chart-extractionDatos de gráficosInformes con gráficos.Paso de modelo adicional
6
Paso 6

Formato de salida

Elige qué quieres hacer con el resultado; la vista previa también actualiza la llamada de exportación del fragmento de Python.

FormatoQué obtienesIdeal para
Markdown (md)Texto legible con tablasNotas, documentación y texto para RAG.
Docling JSON (json)DoclingDocument sin pérdidas con bounding boxesPipelines propios y procesamiento posterior.
HTML (html)Tablas y diseño en HTMLVistas web y correo.
DocTags (doctags)Marcado compacto tipo tokenEntrada de modelos y flujos de tokens.
7
Paso 7

Acelerador e hilos

Docling se ejecuta en CPU, GPU NVIDIA (CUDA) y Apple Silicon (MPS). auto elige CUDA, luego MPS y luego CPU.

  • Usa --device cuda en hardware NVIDIA para lotes grandes.
  • Usa --device mps en Apple Silicon.
  • En CPU, desactiva el OCR y el enriquecimiento que no necesites.
AjusteValoresEfecto
--deviceauto, cuda, mps, cpuDetermina dónde se ejecuta la inferencia neuronal.
--num-threadsEntero (por defecto 4)Paralelismo de CPU; demasiados hilos pueden ralentizar un equipo pequeño.
8
Paso 8

Referencia de flags generados

Estos son los flags que puede emitir el generador, con la opción de Python a la que se asigna cada uno. Para la CLI completa, consulta la referencia de CLI.

FlagValoresAplica aEquivalente en Python
--tomd, json, html, doctagsTodosexport_to_markdown(), export_to_dict(), export_to_html(), export_to_doctags()
--ocr-engineauto, rapidocr, tesserocr, easyocr, ocrmac, nemotron-ocrPDF e imágenespipeline_options.ocr_options
--ocr-modedefault, full_pagePDF e imágenespipeline_options.ocr_options
--no-ocrFlagPDFpipeline_options.do_ocr = False
--table-modeaccurate, fastPDFpipeline_options.do_table_structure
--enrich-codeFlagPDFpipeline_options.do_code_enrichment
--enrich-formulaFlagPDFpipeline_options.do_formula_enrichment
--enrich-chart-extractionFlagPDFpipeline_options.do_chart_extraction
--deviceauto, cuda, mps, cpuTodosAcceleratorOptions(device=...)
--num-threadsEnteroTodosAcceleratorOptions(num_threads=...)
9
Paso 9

El equivalente en Python

El generador crea este fragmento por ti. Para PDF configura un objeto PdfPipelineOptions y lo registra mediante format_options; para cualquier otro formato basta con un DocumentConverter() simple.

  • Cambia export_to_markdown() por export_to_dict() para obtener JSON sin pérdidas.
  • Establece pipeline_options.do_ocr = False para desactivar el OCR.
  • Usa convert_all() para procesar varios archivos.
from docling.document_converter import DocumentConverter, PdfFormatOption
from docling.datamodel.base_models import InputFormat
from docling.datamodel.pipeline_options import PdfPipelineOptions

pipeline_options = PdfPipelineOptions()
pipeline_options.do_ocr = True
pipeline_options.do_table_structure = True

converter = DocumentConverter(
    format_options={InputFormat.PDF: PdfFormatOption(pipeline_options=pipeline_options)}
)

result = converter.convert("report.pdf")
print(result.document.export_to_markdown())
10
Paso 10

Recetas

Copia un ajuste predefinido y cambia el nombre del archivo.

PDF digital, lo más rápido

Sin OCR, salida Markdown.

docling convert report.pdf --to md --no-ocr
PDF escaneado

OCR de página completa y luego Markdown.

docling convert scan.pdf --to md --ocr-mode full_page
Artículo científico

Fórmulas y código enriquecidos.

docling convert paper.pdf --to md --enrich-code --enrich-formula
Estructura legible por máquina

Docling JSON sin pérdidas.

docling convert report.pdf --to json
Documentos de Office

Word, PowerPoint y Excel.

docling convert workbook.xlsx --to md
Lote en GPU

CUDA con más hilos.

docling convert report.pdf --to md --device cuda --num-threads 8
11
Paso 11

Avisos que muestra el generador

El generador comprueba combinaciones y te avisa cuando una elección no tendrá efecto. Verifica siempre los flags inusuales con la referencia oficial de la CLI.

  • Entrada de audio con el OCR activado (el OCR no aplica al pipeline ASR).
  • OcrMac seleccionado en una plataforma que no es macOS.
  • Nemotron OCR seleccionado en CPU.
  • OCR desactivado pero con un motor de OCR aún seleccionado.
12
Paso 12

Rendimiento y privacidad

El generador se ejecuta por completo en tu navegador, y los comandos que produce ejecutan Docling en local.

  • Desactiva el OCR en PDF digitales; mantenlo solo para escaneos.
  • Usa --table-mode fast cuando las tablas aproximadas sean aceptables.
  • Prefiere una GPU para lotes grandes y ajusta --num-threads a tu equipo.
  • No se sube nada: tus selecciones nunca salen del navegador.
13
Paso 13

Sigue explorando

Herramientas y referencias relacionadas.

14
Paso 14

Preguntas frecuentes

¿Se puede ejecutar el comando generado tal cual?
Sí. Usa la sintaxis actual de docling convert y solo las opciones que seleccionaste. Revísalo una vez y ejecútalo en tu entorno.
¿El generador sube mis documentos o ajustes?
No. Todo se calcula localmente en tu navegador; no se envía nada a un servidor. Los comandos generados procesan los documentos en tu equipo.
¿Qué motor de OCR debería elegir?
Empieza con auto. En equipos solo CPU, RapidOCR es una buena opción; usa OcrMac en macOS y Nemotron OCR solo en una GPU CUDA.
¿Por qué el Python generado es distinto de la CLI?
La CLI asigna los flags a las opciones del pipeline internamente. El fragmento de Python hace explícita esa asignación para que puedas ajustarla.
¿Necesito una GPU?
No. Docling funciona en CPU. Una GPU acelera sobre todo el OCR y el enriquecimiento en documentos grandes.
¿Funciona el comando en Windows, macOS y Linux?
Sí. El mismo comando funciona en todas las plataformas; solo cambia la disponibilidad de los motores OCR (OcrMac solo macOS, Nemotron OCR necesita CUDA).
¿Cómo obtengo chunks para RAG en lugar de Markdown?
Genera una exportación Markdown o JSON y pasa el resultado a HybridChunker. Consulta la guía de RAG.
¿Los flags están siempre actualizados?
Siguen la interfaz de docling convert en el momento de la última comprobación. Verifica las opciones inusuales con la referencia oficial de la CLI.