Installer Docling sous Linux

Ubuntu / Debian, RHEL / Fedora et WSL2 avec Python 3.10+. Choisissez d'abord la voie CPU ou CUDA — elle décide quel wheel PyTorch installer. Vérifiez chaque commande contre la documentation officielle d'installation.

1
Step 1

Prérequis + paquets distro

3.10+ requis. Puis installez venv + base de compilation :

python3 --version
sudo apt-get update && sudo apt-get install -y python3 python3-venv python3-pip

RHEL / Fedora :

sudo dnf install -y python3 python3-pip
python3 -m venv .venv && source .venv/bin/activate && pip install -U pip
2
Step 2

Installation CPU-only (serveurs, conteneurs)

Le wheel torch standard embarque les bibliothèques CUDA (2 Go+). Sur machines CPU-only, installez le petit build CPU. Idéal pour runners CI, petits VPS et images Docker CPU. Pleinement utilisable pour les PDF texte ; le travail OCR lourd est juste plus lent que sur GPU.

pip install docling --extra-index-url https://download.pytorch.org/whl/cpu
3
Step 3

Installation CUDA / GPU (NVIDIA)

pip install docling
python -c "import torch; print(torch.cuda.is_available())"
docling convert report.pdf --device cuda
  • Installez pilote NVIDIA + toolkit CUDA selon votre GPU (vĂ©rifiez nvidia-smi).
  • Installez un torch compatible CUDA depuis pytorch.org pour votre CUDA (12.8 / 13.0), puis Docling — ou laissez pip rĂ©soudre le torch CUDA de l'index par dĂ©faut, puis sĂ©lectionnez le pĂ©riphĂ©rique :

torch.cuda.is_available() doit afficher True — sinon réparez pilotes/torch avant de régler les flags Docling. Pour l'OCR sur GPU, ajoutez la voie ONNX Runtime CUDA : pip install "docling[onnxruntime]" et vérifiez que CUDAExecutionProvider figure dans ort.get_available_providers(). Le réglage fin (tailles de batch, serveurs VLM) est dans le guide GPU officiel.

4
Step 4

Configuration de l'index CPU dans uv

Les utilisateurs uv épinglent torch sur l'index CPU dans pyproject.toml pour que chaque collègue et CI obtienne le petit wheel :

uv add docling
[[tool.uv.index]]
name = "pytorch-cpu"
url = "https://download.pytorch.org/whl/cpu"
explicit = true

[tool.uv.sources]
torch = [{ index = "pytorch-cpu" }]
5
Step 5

Paquets système Tesseract

Uniquement pour les moteurs Tesseract. Installez le binaire avant l'extra pip. Pointez TESSDATA_PREFIX vers le dossier des .traineddata (doit finir par /). Sur Debian, trouvez-le via dpkg -L tesseract-ocr-eng | grep tessdata$ ; sur RHEL utilisez /usr/share/tesseract/tessdata/. Si tesserocr ne compile pas : pip uninstall tesserocr puis pip install --no-binary :all: tesserocr.

Debian / Ubuntu :

sudo apt-get install -y tesseract-ocr tesseract-ocr-eng libtesseract-dev libleptonica-dev pkg-config

RHEL / Fedora, puis le binding :

sudo dnf install -y tesseract tesseract-devel tesseract-langpack-eng tesseract-osd leptonica-devel
pip install "docling[tesserocr]"
6
Step 6

Extras OCR et pipeline sous Linux

BesoinInstallationRestriction
RapidOCR (recommandé)pip install "docling[rapidocr]"Aucune — pip seul.
EasyOCRpip install "docling[easyocr]"Aucune — pip seul.
Pipeline VLMpip install "docling[vlm]"GPU vivement recommandé.
ASR (audio)pip install "docling[asr]"Aucune.
Nemotron OCRpip install "docling[feat-ocr-nemotron]" --extra-index-url https://download.pytorch.org/whl/cu130 --index-strategy unsafe-best-matchLinux x86_64 + Python 3.12 + CUDA 13.x uniquement.
7
Step 7

Vérification (CPU vs GPU)

Le premier lancement télécharge les modèles — gardez la connexion ou pré-téléchargez avec docling-tools models download --all. Utilisez --device cpu pour forcer CPU et comparer, --device cuda pour NVIDIA.

docling --help
docling convert sample.pdf --to md
docling convert sample.pdf --device auto --to md
8
Step 8

PlutĂ´t conteneurs ? Utilisez docling-serve

Pour une API HTTP plutôt que le CLI, lancez le conteneur officiel (image CPU montrée) — référence complète sur la page Docker :

podman run -p 5001:5001 -e DOCLING_SERVE_ENABLE_UI=1 quay.io/docling-project/docling-serve-cpu
9
Step 9

Problèmes Linux fréquents

  • GPU ignorĂ© — voir GPU non utilisĂ© : mauvais build torch ou pilotes manquants.
  • MĂ©moire pleine — voir mĂ©moire pleine : convertissez un par un, baissez --num-threads, ajoutez --no-ocr pour les PDF numĂ©riques.
  • Taille d'installation Ă©norme — vous avez pris le torch CUDA sur une machine CPU ; rĂ©installez avec la ligne --extra-index-url …/cpu.
  • Tesseract sans langues — installez les paquets tesseract-ocr-langue et exportez TESSDATA_PREFIX.
  • Erreurs de permission — utilisez un venv ; jamais sudo pip install.
10
Step 10

FAQ Linux

torch CPU ou CUDA ?
Serveurs CPU-only et CI : l'index /whl/cpu (petit, téléchargement rapide). Toute machine NVIDIA où vous voulez de la vitesse : un torch CUDA plus --device cuda.
Quelle version CUDA ?
Celle de vos pilotes (nvidia-smi). docling-serve publie des images -cu128 et -cu130 ; pour pip, prenez l'index torch que pytorch.org recommande pour ce CUDA.
Puis-je utiliser Nemotron OCR ?
Uniquement sur Linux x86_64 avec Python 3.12 et CUDA 13.x, installé avec l'extra feat-ocr-nemotron plus l'index cu130 et la stratégie unsafe-best-match.
apt ou pip pour Tesseract ?
Les deux : binaire et bibliothèques dev depuis apt/dnf, le binding Python (tesserocr) depuis pip. Définissez ensuite TESSDATA_PREFIX.

VĂ©rifiĂ© avec Docling v2.129.0 · Dernière vĂ©rification 2026-09-22 · Source officielle