Instalar Docling en Linux
Ubuntu / Debian, RHEL / Fedora y WSL2 con Python 3.10+. Elige primero la vía CPU o CUDA: decide qué wheel PyTorch instalas. Verifica cada comando contra la documentación oficial de instalación.
Requisitos + paquetes de la distro
3.10+ necesario. Luego instala venv + base de compilación:
python3 --versionsudo apt-get update && sudo apt-get install -y python3 python3-venv python3-pipRHEL / Fedora:
sudo dnf install -y python3 python3-pippython3 -m venv .venv && source .venv/bin/activate && pip install -U pipInstalación solo-CPU (servidores, contenedores)
El wheel torch por defecto incluye librerías CUDA (2 GB+). En máquinas solo-CPU instala el build CPU pequeño. Ideal para runners CI, VPS pequeños e imágenes Docker CPU. Totalmente válido para PDF de texto; el trabajo OCR pesado es solo más lento que en GPU.
pip install docling --extra-index-url https://download.pytorch.org/whl/cpuInstalación CUDA / GPU (NVIDIA)
pip install doclingpython -c "import torch; print(torch.cuda.is_available())"docling convert report.pdf --device cuda- Instala driver NVIDIA + toolkit CUDA según tu GPU (revisa
nvidia-smi). - Instala un torch con CUDA desde pytorch.org para tu CUDA (12.8 / 13.0) y luego Docling — o deja que pip resuelva el torch CUDA del índice por defecto y selecciona el dispositivo:
torch.cuda.is_available() debe imprimir True: si no, arregla drivers/torch antes de ajustar flags Docling. Para OCR en GPU añade la vía ONNX Runtime CUDA: pip install "docling[onnxruntime]" y confirma que CUDAExecutionProvider aparezca en ort.get_available_providers(). El ajuste fino (tamaños de lote, servidores VLM) está en la guía oficial GPU.
Configuración del índice CPU en uv
Los usuarios uv fijan torch al índice CPU en pyproject.toml para que cada colega y CI obtenga el wheel pequeño:
uv add docling[[tool.uv.index]]
name = "pytorch-cpu"
url = "https://download.pytorch.org/whl/cpu"
explicit = true
[tool.uv.sources]
torch = [{ index = "pytorch-cpu" }]
Paquetes de sistema Tesseract
Solo para motores Tesseract. Instala el binario antes del extra pip. Apunta TESSDATA_PREFIX a la carpeta con .traineddata (debe terminar en /). En Debian encuéntralo con dpkg -L tesseract-ocr-eng | grep tessdata$; en RHEL usa /usr/share/tesseract/tessdata/. Si tesserocr no compila: pip uninstall tesserocr y pip install --no-binary :all: tesserocr.
Debian / Ubuntu:
sudo apt-get install -y tesseract-ocr tesseract-ocr-eng libtesseract-dev libleptonica-dev pkg-configRHEL / Fedora, y luego el binding:
sudo dnf install -y tesseract tesseract-devel tesseract-langpack-eng tesseract-osd leptonica-develpip install "docling[tesserocr]"Extras OCR y de pipeline en Linux
| Necesidad | Instalación | Restricción |
|---|---|---|
| RapidOCR (recomendado) | pip install "docling[rapidocr]" | Ninguna: solo pip. |
| EasyOCR | pip install "docling[easyocr]" | Ninguna: solo pip. |
| Pipeline VLM | pip install "docling[vlm]" | GPU muy recomendada. |
| ASR (audio) | pip install "docling[asr]" | Ninguna. |
| Nemotron OCR | pip install "docling[feat-ocr-nemotron]" --extra-index-url https://download.pytorch.org/whl/cu130 --index-strategy unsafe-best-match | Solo Linux x86_64 + Python 3.12 + CUDA 13.x. |
Verificación (CPU frente a GPU)
La primera ejecución descarga modelos: mantén la conexión o pre-descarga con docling-tools models download --all. Usa --device cpu para forzar CPU y comparar, --device cuda para NVIDIA.
docling --helpdocling convert sample.pdf --to mddocling convert sample.pdf --device auto --to md¿Prefieres contenedores? Usa docling-serve
Para una API HTTP en vez del CLI, ejecuta el contenedor oficial (imagen CPU mostrada); referencia completa en la página Docker:
podman run -p 5001:5001 -e DOCLING_SERVE_ENABLE_UI=1 quay.io/docling-project/docling-serve-cpuProblemas comunes en Linux
- GPU ignorada — ver GPU no usada: build torch erróneo o drivers ausentes.
- Sin memoria — ver sin memoria: convierte de uno en uno, baja
--num-threads, añade--no-ocren PDF digitales. - Tamaño de instalación enorme — trajiste el torch CUDA a una máquina CPU; reinstala con la línea
--extra-index-url …/cpu. - Tesseract sin idiomas — instala los paquetes
tesseract-ocr-idiomay exportaTESSDATA_PREFIX. - Errores de permiso — usa un venv; nunca
sudo pip install.
FAQ de Linux
¿torch CPU o CUDA?
/whl/cpu (pequeño, descarga rápida). Cualquier máquina NVIDIA donde quieras velocidad: un torch con CUDA más --device cuda.¿Qué versión CUDA?
nvidia-smi). docling-serve publica imágenes -cu128 y -cu130; para pip elige el índice torch que pytorch.org recomiende para ese CUDA.¿Puedo usar Nemotron OCR?
feat-ocr-nemotron más índice cu130 y estrategia unsafe-best-match.¿apt o pip para Tesseract?
tesserocr) desde pip. Después define TESSDATA_PREFIX.Verificado con Docling v2.129.0 · Última comprobación 2026-09-22 · Fuente oficial