Instalar Docling en Linux

Ubuntu / Debian, RHEL / Fedora y WSL2 con Python 3.10+. Elige primero la vía CPU o CUDA: decide qué wheel PyTorch instalas. Verifica cada comando contra la documentación oficial de instalación.

1
Step 1

Requisitos + paquetes de la distro

3.10+ necesario. Luego instala venv + base de compilación:

python3 --version
sudo apt-get update && sudo apt-get install -y python3 python3-venv python3-pip

RHEL / Fedora:

sudo dnf install -y python3 python3-pip
python3 -m venv .venv && source .venv/bin/activate && pip install -U pip
2
Step 2

Instalación solo-CPU (servidores, contenedores)

El wheel torch por defecto incluye librerías CUDA (2 GB+). En máquinas solo-CPU instala el build CPU pequeño. Ideal para runners CI, VPS pequeños e imágenes Docker CPU. Totalmente válido para PDF de texto; el trabajo OCR pesado es solo más lento que en GPU.

pip install docling --extra-index-url https://download.pytorch.org/whl/cpu
3
Step 3

Instalación CUDA / GPU (NVIDIA)

pip install docling
python -c "import torch; print(torch.cuda.is_available())"
docling convert report.pdf --device cuda
  • Instala driver NVIDIA + toolkit CUDA según tu GPU (revisa nvidia-smi).
  • Instala un torch con CUDA desde pytorch.org para tu CUDA (12.8 / 13.0) y luego Docling — o deja que pip resuelva el torch CUDA del índice por defecto y selecciona el dispositivo:

torch.cuda.is_available() debe imprimir True: si no, arregla drivers/torch antes de ajustar flags Docling. Para OCR en GPU añade la vía ONNX Runtime CUDA: pip install "docling[onnxruntime]" y confirma que CUDAExecutionProvider aparezca en ort.get_available_providers(). El ajuste fino (tamaños de lote, servidores VLM) está en la guía oficial GPU.

4
Step 4

Configuración del índice CPU en uv

Los usuarios uv fijan torch al índice CPU en pyproject.toml para que cada colega y CI obtenga el wheel pequeño:

uv add docling
[[tool.uv.index]]
name = "pytorch-cpu"
url = "https://download.pytorch.org/whl/cpu"
explicit = true

[tool.uv.sources]
torch = [{ index = "pytorch-cpu" }]
5
Step 5

Paquetes de sistema Tesseract

Solo para motores Tesseract. Instala el binario antes del extra pip. Apunta TESSDATA_PREFIX a la carpeta con .traineddata (debe terminar en /). En Debian encuéntralo con dpkg -L tesseract-ocr-eng | grep tessdata$; en RHEL usa /usr/share/tesseract/tessdata/. Si tesserocr no compila: pip uninstall tesserocr y pip install --no-binary :all: tesserocr.

Debian / Ubuntu:

sudo apt-get install -y tesseract-ocr tesseract-ocr-eng libtesseract-dev libleptonica-dev pkg-config

RHEL / Fedora, y luego el binding:

sudo dnf install -y tesseract tesseract-devel tesseract-langpack-eng tesseract-osd leptonica-devel
pip install "docling[tesserocr]"
6
Step 6

Extras OCR y de pipeline en Linux

NecesidadInstalaciónRestricción
RapidOCR (recomendado)pip install "docling[rapidocr]"Ninguna: solo pip.
EasyOCRpip install "docling[easyocr]"Ninguna: solo pip.
Pipeline VLMpip install "docling[vlm]"GPU muy recomendada.
ASR (audio)pip install "docling[asr]"Ninguna.
Nemotron OCRpip install "docling[feat-ocr-nemotron]" --extra-index-url https://download.pytorch.org/whl/cu130 --index-strategy unsafe-best-matchSolo Linux x86_64 + Python 3.12 + CUDA 13.x.
7
Step 7

Verificación (CPU frente a GPU)

La primera ejecución descarga modelos: mantén la conexión o pre-descarga con docling-tools models download --all. Usa --device cpu para forzar CPU y comparar, --device cuda para NVIDIA.

docling --help
docling convert sample.pdf --to md
docling convert sample.pdf --device auto --to md
8
Step 8

¿Prefieres contenedores? Usa docling-serve

Para una API HTTP en vez del CLI, ejecuta el contenedor oficial (imagen CPU mostrada); referencia completa en la página Docker:

podman run -p 5001:5001 -e DOCLING_SERVE_ENABLE_UI=1 quay.io/docling-project/docling-serve-cpu
9
Step 9

Problemas comunes en Linux

  • GPU ignorada — ver GPU no usada: build torch erróneo o drivers ausentes.
  • Sin memoria — ver sin memoria: convierte de uno en uno, baja --num-threads, añade --no-ocr en PDF digitales.
  • Tamaño de instalación enorme — trajiste el torch CUDA a una máquina CPU; reinstala con la línea --extra-index-url …/cpu.
  • Tesseract sin idiomas — instala los paquetes tesseract-ocr-idioma y exporta TESSDATA_PREFIX.
  • Errores de permiso — usa un venv; nunca sudo pip install.
10
Step 10

FAQ de Linux

¿torch CPU o CUDA?
Servidores solo-CPU y CI: el índice /whl/cpu (pequeño, descarga rápida). Cualquier máquina NVIDIA donde quieras velocidad: un torch con CUDA más --device cuda.
¿Qué versión CUDA?
La que corresponda a tus drivers (nvidia-smi). docling-serve publica imágenes -cu128 y -cu130; para pip elige el índice torch que pytorch.org recomiende para ese CUDA.
¿Puedo usar Nemotron OCR?
Solo en Linux x86_64 con Python 3.12 y CUDA 13.x, instalado con el extra feat-ocr-nemotron más índice cu130 y estrategia unsafe-best-match.
¿apt o pip para Tesseract?
Ambos: binario y librerías dev desde apt/dnf, el binding Python (tesserocr) desde pip. Después define TESSDATA_PREFIX.

Verificado con Docling v2.129.0 · Última comprobación 2026-09-22 · Fuente oficial