Docling simplifica la conversión de documentos complejos procesando PDFs, archivos de Office, imágenes y audio en formatos Markdown y JSON estructurados. Diseñado específicamente para aplicaciones de IA Generativa, RAG y flujos de trabajo de agentes.
Docling es un motor de código abierto para conversión de documentos y análisis de diseño desarrollado por IBM Research y mantenido bajo la Fundación LF AI & Data. Convierte automáticamente formatos heterogéneos — incluyendo PDFs complejos, Microsoft Word (DOCX), PowerPoint (PPTX), Excel (XLSX), HTML, EPUB, imágenes escaneadas y pistas de audio — en formatos unificados como Markdown y JSON estructurado. Impulsado por Granite Docling y TableFormer, proporciona una precisión insuperable en la reconstrucción de tablas y el orden de lectura para sistemas RAG.
Todo lo necesario para transformar documentos brutos en datos limpios y estructurados para LLMs.
Procesa PDF, DOCX, PPTX, XLSX, HTML, EPUB, AsciiDoc, LaTeX, CSV, pistas de audio (WAV, MP3) y XML de patentes (USPTO, JATS) con una API unificada.
Reconoce diseños científicos multi-columna, barras laterales, encabezados, pies de página y jerarquías visuales de lectura.
Modelo neuronal de última generación para reconstruir celdas complejas fusionadas y tablas financieras sin bordes.
Elija entre EasyOCR, Tesseract, RapidOCR, OcrMac o NVIDIA Nemotron OCR para extraer texto de escaneos.
Segmente documentos en nodos estructurales preservando jerarquía de títulos, tablas y metadatos espaciales.
Exporte a Markdown, JSON o DocTags con integraciones nativas para LangChain, LlamaIndex, Haystack, CrewAI y servidor MCP.
Docling se ejecuta de forma local en Windows (64-bit), macOS (Apple Silicon e Intel) y Linux.
Cómo se compara Docling con otras herramientas de extracción documental para IA.
A diferencia de extractores básicos como PyPDF o pdfplumber, Docling realiza análisis visual de diseño, recupera el orden de lectura y reconstruye tablas complejas con TableFormer. Frente a Unstructured.io, funciona 100% en local sin APIs de pago forzadas y se integra de forma nativa con servidores MCP.
| Característica / Métrica | Docling (v2.115) | Unstructured.io | PyPDF / pdfplumber | Marker |
|---|---|---|---|---|
| Análisis de Diseño Complejo en PDF | ||||
| Reconocimiento de Tablas (TableFormer) | Parcial / API de pago | Cuadrícula básica | ||
| Transcripción de Audio / Vídeo (ASR) | (Whisper) | |||
| Servidor MCP (Model Context Protocol) | (Nativo) | |||
| 100% Open Source Gratuito (MIT) | Apache 2.0 / Comercial | BSD / MIT | GPL v3 / Comercial |
Comandos de CLI listos para copiar y pegar.
Convierte un PDF local y guarda el resultado en Markdown.
docling report.pdf --to md
Descarga y procesa un documento directamente desde una URL HTTP.
docling https://arxiv.org/pdf/2408.09869
Fuerza el motor OCR sobre todas las páginas del PDF.
docling scan.pdf --ocr-mode full_page
Exporta el esquema JSON con coordenadas exactas.
docling document.pdf --to json
Extrae fórmulas LaTeX y bloques de código con modelos dedicados.
docling paper.pdf --enrich-code --enrich-formula
Convierte pistas de audio MP3 o WAV en texto estructurado.
docling lecture.mp3 --pipeline asr --to md
Descarga modelos en la caché local para uso offline.
docling-tools models download --all
Inicia el servidor MCP para conectar con Claude Desktop.
uvx --from=docling-mcp docling-mcp-server
Personalice opciones y obtenga comandos ejecutables y scripts en tiempo real.
Respuestas claras sobre instalación, soporte OCR, privacidad y rendimiento.
pip para compilar extensiones de C++ como tesserocr, se requiere Microsoft Visual C++ 14.0+. La alternativa recomendada es usar Astral uv (uv add docling), que instala binarios precompilados sin necesidad de compilador.
pipeline_options.do_ocr = False en Python o pasando --no-ocr en la CLI. Esto proporciona una velocidad entre 5x y 10x superior.
.xlsx) convirtiendo cada hoja en tablas estructuradas en Markdown/HTML, y presentaciones de PowerPoint (.pptx) extrayendo jerarquías de diapositivas y notas del orador.