Installer Docling sous Linux
Ubuntu / Debian, RHEL / Fedora et WSL2 avec Python 3.10+. Choisissez d'abord la voie CPU ou CUDA — elle décide quel wheel PyTorch installer. Vérifiez chaque commande contre la documentation officielle d'installation.
Prérequis + paquets distro
3.10+ requis. Puis installez venv + base de compilation :
python3 --versionsudo apt-get update && sudo apt-get install -y python3 python3-venv python3-pipRHEL / Fedora :
sudo dnf install -y python3 python3-pippython3 -m venv .venv && source .venv/bin/activate && pip install -U pipInstallation CPU-only (serveurs, conteneurs)
Le wheel torch standard embarque les bibliothèques CUDA (2 Go+). Sur machines CPU-only, installez le petit build CPU. Idéal pour runners CI, petits VPS et images Docker CPU. Pleinement utilisable pour les PDF texte ; le travail OCR lourd est juste plus lent que sur GPU.
pip install docling --extra-index-url https://download.pytorch.org/whl/cpuInstallation CUDA / GPU (NVIDIA)
pip install doclingpython -c "import torch; print(torch.cuda.is_available())"docling convert report.pdf --device cuda- Installez pilote NVIDIA + toolkit CUDA selon votre GPU (vérifiez
nvidia-smi). - Installez un torch compatible CUDA depuis pytorch.org pour votre CUDA (12.8 / 13.0), puis Docling — ou laissez pip résoudre le torch CUDA de l'index par défaut, puis sélectionnez le périphérique :
torch.cuda.is_available() doit afficher True — sinon réparez pilotes/torch avant de régler les flags Docling. Pour l'OCR sur GPU, ajoutez la voie ONNX Runtime CUDA : pip install "docling[onnxruntime]" et vérifiez que CUDAExecutionProvider figure dans ort.get_available_providers(). Le réglage fin (tailles de batch, serveurs VLM) est dans le guide GPU officiel.
Configuration de l'index CPU dans uv
Les utilisateurs uv épinglent torch sur l'index CPU dans pyproject.toml pour que chaque collègue et CI obtienne le petit wheel :
uv add docling[[tool.uv.index]]
name = "pytorch-cpu"
url = "https://download.pytorch.org/whl/cpu"
explicit = true
[tool.uv.sources]
torch = [{ index = "pytorch-cpu" }]
Paquets système Tesseract
Uniquement pour les moteurs Tesseract. Installez le binaire avant l'extra pip. Pointez TESSDATA_PREFIX vers le dossier des .traineddata (doit finir par /). Sur Debian, trouvez-le via dpkg -L tesseract-ocr-eng | grep tessdata$ ; sur RHEL utilisez /usr/share/tesseract/tessdata/. Si tesserocr ne compile pas : pip uninstall tesserocr puis pip install --no-binary :all: tesserocr.
Debian / Ubuntu :
sudo apt-get install -y tesseract-ocr tesseract-ocr-eng libtesseract-dev libleptonica-dev pkg-configRHEL / Fedora, puis le binding :
sudo dnf install -y tesseract tesseract-devel tesseract-langpack-eng tesseract-osd leptonica-develpip install "docling[tesserocr]"Extras OCR et pipeline sous Linux
| Besoin | Installation | Restriction |
|---|---|---|
| RapidOCR (recommandé) | pip install "docling[rapidocr]" | Aucune — pip seul. |
| EasyOCR | pip install "docling[easyocr]" | Aucune — pip seul. |
| Pipeline VLM | pip install "docling[vlm]" | GPU vivement recommandé. |
| ASR (audio) | pip install "docling[asr]" | Aucune. |
| Nemotron OCR | pip install "docling[feat-ocr-nemotron]" --extra-index-url https://download.pytorch.org/whl/cu130 --index-strategy unsafe-best-match | Linux x86_64 + Python 3.12 + CUDA 13.x uniquement. |
Vérification (CPU vs GPU)
Le premier lancement télécharge les modèles — gardez la connexion ou pré-téléchargez avec docling-tools models download --all. Utilisez --device cpu pour forcer CPU et comparer, --device cuda pour NVIDIA.
docling --helpdocling convert sample.pdf --to mddocling convert sample.pdf --device auto --to mdPlutĂ´t conteneurs ? Utilisez docling-serve
Pour une API HTTP plutôt que le CLI, lancez le conteneur officiel (image CPU montrée) — référence complète sur la page Docker :
podman run -p 5001:5001 -e DOCLING_SERVE_ENABLE_UI=1 quay.io/docling-project/docling-serve-cpuProblèmes Linux fréquents
- GPU ignoré — voir GPU non utilisé : mauvais build torch ou pilotes manquants.
- Mémoire pleine — voir mémoire pleine : convertissez un par un, baissez
--num-threads, ajoutez--no-ocrpour les PDF numériques. - Taille d'installation énorme — vous avez pris le torch CUDA sur une machine CPU ; réinstallez avec la ligne
--extra-index-url …/cpu. - Tesseract sans langues — installez les paquets
tesseract-ocr-langueet exportezTESSDATA_PREFIX. - Erreurs de permission — utilisez un venv ; jamais
sudo pip install.
FAQ Linux
torch CPU ou CUDA ?
/whl/cpu (petit, téléchargement rapide). Toute machine NVIDIA où vous voulez de la vitesse : un torch CUDA plus --device cuda.Quelle version CUDA ?
nvidia-smi). docling-serve publie des images -cu128 et -cu130 ; pour pip, prenez l'index torch que pytorch.org recommande pour ce CUDA.Puis-je utiliser Nemotron OCR ?
feat-ocr-nemotron plus l'index cu130 et la stratégie unsafe-best-match.apt ou pip pour Tesseract ?
tesserocr) depuis pip. DĂ©finissez ensuite TESSDATA_PREFIX.VĂ©rifiĂ© avec Docling v2.129.0 · Dernière vĂ©rification 2026-09-22 · Source officielle