Installer Docling
Le chemin complet et vérifié de zéro à votre première conversion — setup Python, pip vs uv, environnements virtuels, chaque extra optionnel, builds PyTorch CPU / CUDA / MPS, paquets système Tesseract, téléchargements de modèles, vérification et correctifs par OS. Fonctionne sur macOS, Linux et Windows (x86_64 et arm64).
Quelle voie d'installation choisir ?
| Situation | Commencez ici | Pourquoi |
|---|---|---|
| Convertir des PDF en local | pip install docling | Paquet de base ; ni Docker ni serveur requis. |
| Sous Windows avec erreurs de compilation | Guide Windows + uv add docling | uv résout des wheels précompilées et évite MSVC. |
| Besoin d'une API HTTP pour une app | Guide Docker / docling-serve | Conteneur officiel avec /v1/convert/source, /docs, /ui. |
| Besoin de vitesse GPU sous Linux | Guide Linux | torch compatible CUDA + --device cuda. |
| Sur un Mac | Guide macOS | Apple Silicon utilise MPS ; Intel exige torch épinglé. |
| PDF scannés / OCR | Tableau des extras + Guide OCR | Choisir RapidOCR, EasyOCR, Tesseract ou OcrMac. |
Prérequis (toutes plateformes)
Si la sortie est inférieure à 3.10, installez d'abord un Python plus récent — tout ce qui suit suppose 3.10+ :
python --version && pip --version- Python 3.10 ou plus récent, 64-bit. Le support de Python 3.9 a été abandonné dans Docling 2.70.0. Pour des versions très récentes, vérifiez l'historique PyPI si aucun wheel n'existe encore.
- pip 23+ ou Astral uv. uv est plus rapide et évite la plupart des problèmes de compilation sous Windows.
- ~2–4 Go d'espace libre pour les modèles au premier lancement (layout, tableaux, OCR).
- Internet fonctionnel au premier lancement pour télécharger les modèles (machines hors ligne : voir cache de modèles).
- Optionnel : binaire système Tesseract (moteurs Tesseract uniquement), pilotes CUDA (GPU NVIDIA uniquement), Docker (docling-serve uniquement).
Créer un environnement isolé (recommandé)
Option A — venv + pip (partout) : sous PowerShell Windows, utilisez .venv\Scripts\Activate.ps1 au lieu de la ligne source.
python -m venv .venvsource .venv/bin/activatepython -m pip install -U pip- Docling entraîne PyTorch, ONNX et des bibliothèques OCR. Ne l'installez jamais dans le Python système — un seul
torchounumpyen conflit peut casser d'autres outils.
Option B — uv (la plus rapide, la meilleure sous Windows) :
uv venv --python 3.12uv add doclingInstallation rapide : pip vs uv
Standard (pip) : les deux installent le même paquet depuis PyPI sur macOS, Linux et Windows (x86_64 + arm64). Les instructions officielles complètes sont dans la documentation officielle d'installation.
pip install doclinguv add doclingAvec uv (résout des wheels précompilées et évite les outils de compilation C++) : voir la commande ci-dessus.
Tous les extras optionnels, expliqués
Le paquet de base couvre la conversion standard. Tout ce qui exige de lourdes dépendances tierces est un extra : pip install "docling[NOM]" (combinables par virgules : "docling[rapidocr,vlm]").
| Extra | Ce qu'il ajoute | Installation |
|---|---|---|
| rapidocr | Moteur RapidOCR (backend ONNX Runtime) — l'OCR multiplateforme le plus simple | pip install "docling[rapidocr]" |
| easyocr | Moteur EasyOCR — installation pure Python, bonne couverture multilingue | pip install "docling[easyocr]" |
| tesserocr | Binding Tesseract rapide (exige d'abord le Tesseract système, voir ci-dessous) | pip install "docling[tesserocr]" |
| ocrmac | OCR Apple Vision — macOS uniquement | pip install "docling[ocrmac]" |
| vlm | Pipeline de modèles vision-langage (dont Granite Docling) | pip install "docling[vlm]" |
| asr | Pipeline de reconnaissance vocale (Whisper) | pip install "docling[asr]" |
| htmlrender | Rendu de pages HTML pour le backend HTML | pip install "docling[htmlrender]" |
| feat-ocr-nemotron | NVIDIA Nemotron OCR — Linux x86_64 + Python 3.12 + CUDA 13.x uniquement | pip install "docling[feat-ocr-nemotron]" --extra-index-url https://download.pytorch.org/whl/cu130 --index-strategy unsafe-best-match |
| mac_intel | torch épinglé pour Macs Intel (PyTorch ≥2.6 sans wheels Intel) | pip install "docling[mac_intel]" |
Pour l'OCR : RapidOCR et EasyOCR s'installent par pip seul ; les variantes Tesseract exigent d'abord le binaire système. Comparez les moteurs dans le guide OCR.
Builds PyTorch : CPU-only, CUDA, MPS, Macs Intel
Les modèles Docling tournent sur PyTorch. Le wheel standard convient à la plupart, trois cas exigent un build spécial :
pip install docling --extra-index-url https://download.pytorch.org/whl/cpuuv add torch==2.2.2 torchvision==0.17.2 doclingpip install "docling[mac_intel]"- Serveurs Linux CPU-only : prenez le petit build CPU plutôt que le gros wheel CUDA (voir commande ci-dessous).
- GPU NVIDIA sous Linux/Windows : installez un torch compatible CUDA pour votre version CUDA, puis sélectionnez-le avec
--device cuda. Sous Windows, WSL2 est le chemin CUDA le plus simple — détails dans le guide Windows. - macOS Intel (x86_64) : PyTorch 2.6.0+ ne fournit plus de wheels Intel. Épinglez le dernier build compatible et restez sur Python ≤3.12.
- Apple Silicon : fonctionne directement ; sélectionnez le backend MPS avec
--device mpsau besoin (voir guide macOS).
Paquets système Tesseract + TESSDATA_PREFIX
Nécessaire uniquement avec un moteur Tesseract. Installez le binaire avec le gestionnaire de paquets avant l'extra pip, puis pointez TESSDATA_PREFIX vers les données de langue (avec / final) :
| OS | Installation | Exemple TESSDATA_PREFIX |
|---|---|---|
| macOS (Homebrew) | brew install tesseract leptonica pkg-config | /opt/homebrew/share/tessdata/ |
| Ubuntu / Debian | sudo apt-get install tesseract-ocr tesseract-ocr-eng libtesseract-dev libleptonica-dev pkg-config | via dpkg -L tesseract-ocr-eng | grep tessdata$ |
| RHEL / Fedora | sudo dnf install tesseract tesseract-devel tesseract-langpack-eng tesseract-osd leptonica-devel | /usr/share/tesseract/tessdata/ |
| Windows | Installez le build UB Mannheim, ajoutez-le au PATH | pointez TESSDATA_PREFIX vers son dossier tessdata\\ |
Si tesserocr refuse de compiler : pip uninstall tesserocr, puis pip install --no-binary :all: tesserocr.
Vérifiez votre installation
Exécutez ces trois contrôles dans l'ordre — chacun isole une couche de panne différente. Utilisez d'abord un petit PDF numérique (texte) pour écarter OCR et GPU. Essayez ensuite --to json, --to html et --ocr-engine rapidocr. En cas d'échec, voir section 11 ou le dépannage.
docling --helppython -c "import docling; print(docling.__version__)"docling convert sample.pdf --to mdLe premier lancement télécharge les modèles — prévoyez-le
docling-tools models download --all- La première conversion télécharge les modèles de layout, de tableaux et d'OCR : lent une fois, rapide ensuite.
- Gardez une connexion stable pour ce premier lancement ; un téléchargement partiel laisse un cache corrompu — relancez simplement.
- Pré-téléchargez tout :
- Pointez le cache vers un disque inscriptible avec
DOCLING_CACHE_DIRsi l'emplacement par défaut est en lecture seule ou trop petit. - Machines isolées : téléchargez sur un hôte connecté, puis copiez le répertoire de cache.
Mettre à jour, épingler et désinstaller
Épinglez une version exacte en production (requirements.txt, lockfile ou tag de conteneur) pour qu'aucun changement de modèle ou de CLI ne vous surprenne. Ce site est vérifié contre la version du badge ci-dessous.
pip install -U doclingpip install "docling==2.129.0"pip uninstall doclingCorriger les 5 échecs d'installation les plus fréquents
Microsoft Visual C++ 14.0 is required(Windows) : passez àuv add doclingpour des wheels précompilées, ou installez les Build Tools viawinget install Microsoft.VisualStudio.2022.BuildToolsavec la charge C++. Détails dans le guide Windows et le dépannage.- Erreurs de version Python : créez un environnement frais en 3.10–3.12 (
uv venv --python 3.12). Python 3.9 n'est plus supporté depuis 2.70.0. - L'extra OCR échoue : prenez
rapidocroueasyocr(pip seul) ; pour Tesseract, installez d'abord le binaire système +TESSDATA_PREFIX. - GPU ignoré (tourne sur CPU) : vérifiez que
torch.cuda.is_available()renvoie True, installez un torch CUDA, passez--device cuda(MPS sur Apple Silicon). - Mémoire pleine / très lent : convertissez un fichier à la fois, baissez
--num-threads, ajoutez--no-ocrpour les PDF numériques.
FAQ d'installation
Quelle version Python pour Docling ?
pip ou uv — que choisir ?
uv add docling, sinon pip install docling suffit.Faut-il Docker ?
docling-serve, le serveur API HTTP en conteneur. Voir le guide Docker.Faut-il un GPU ?
Pourquoi la première conversion est-elle si lente ?
docling-tools models download --all. Ensuite le cache est réutilisé.Quel moteur OCR s'installe le plus facilement ?
docling[rapidocr]) ou EasyOCR (docling[easyocr]) — les deux par pip seul. Tesseract est excellent mais exige binaire système plus données ; OcrMac ne fonctionne que sur macOS.Installer Docling hors ligne ?
DOCLING_CACHE_DIR vers le cache copié sur l'hôte isolé.Vérifié avec Docling v2.129.0 · Dernière vérification 2026-09-22 · Source officielle