Installer Docling

Le chemin complet et vérifié de zéro à votre première conversion — setup Python, pip vs uv, environnements virtuels, chaque extra optionnel, builds PyTorch CPU / CUDA / MPS, paquets système Tesseract, téléchargements de modèles, vérification et correctifs par OS. Fonctionne sur macOS, Linux et Windows (x86_64 et arm64).

1
Step 1

Quelle voie d'installation choisir ?

SituationCommencez iciPourquoi
Convertir des PDF en localpip install doclingPaquet de base ; ni Docker ni serveur requis.
Sous Windows avec erreurs de compilationGuide Windows + uv add doclinguv résout des wheels précompilées et évite MSVC.
Besoin d'une API HTTP pour une appGuide Docker / docling-serveConteneur officiel avec /v1/convert/source, /docs, /ui.
Besoin de vitesse GPU sous LinuxGuide Linuxtorch compatible CUDA + --device cuda.
Sur un MacGuide macOSApple Silicon utilise MPS ; Intel exige torch épinglé.
PDF scannés / OCRTableau des extras + Guide OCRChoisir RapidOCR, EasyOCR, Tesseract ou OcrMac.
2
Step 2

Prérequis (toutes plateformes)

Si la sortie est inférieure à 3.10, installez d'abord un Python plus récent — tout ce qui suit suppose 3.10+ :

python --version && pip --version
  • Python 3.10 ou plus récent, 64-bit. Le support de Python 3.9 a été abandonné dans Docling 2.70.0. Pour des versions très récentes, vérifiez l'historique PyPI si aucun wheel n'existe encore.
  • pip 23+ ou Astral uv. uv est plus rapide et évite la plupart des problèmes de compilation sous Windows.
  • ~2–4 Go d'espace libre pour les modèles au premier lancement (layout, tableaux, OCR).
  • Internet fonctionnel au premier lancement pour télécharger les modèles (machines hors ligne : voir cache de modèles).
  • Optionnel : binaire système Tesseract (moteurs Tesseract uniquement), pilotes CUDA (GPU NVIDIA uniquement), Docker (docling-serve uniquement).
3
Step 3

Créer un environnement isolé (recommandé)

Option A — venv + pip (partout) : sous PowerShell Windows, utilisez .venv\Scripts\Activate.ps1 au lieu de la ligne source.

python -m venv .venv
source .venv/bin/activate
python -m pip install -U pip
  • Docling entraîne PyTorch, ONNX et des bibliothèques OCR. Ne l'installez jamais dans le Python système — un seul torch ou numpy en conflit peut casser d'autres outils.

Option B — uv (la plus rapide, la meilleure sous Windows) :

uv venv --python 3.12
uv add docling
4
Step 4

Installation rapide : pip vs uv

Standard (pip) : les deux installent le même paquet depuis PyPI sur macOS, Linux et Windows (x86_64 + arm64). Les instructions officielles complètes sont dans la documentation officielle d'installation.

pip install docling
uv add docling

Avec uv (résout des wheels précompilées et évite les outils de compilation C++) : voir la commande ci-dessus.

5
Step 5

Tous les extras optionnels, expliqués

Le paquet de base couvre la conversion standard. Tout ce qui exige de lourdes dépendances tierces est un extra : pip install "docling[NOM]" (combinables par virgules : "docling[rapidocr,vlm]").

ExtraCe qu'il ajouteInstallation
rapidocrMoteur RapidOCR (backend ONNX Runtime) — l'OCR multiplateforme le plus simplepip install "docling[rapidocr]"
easyocrMoteur EasyOCR — installation pure Python, bonne couverture multilinguepip install "docling[easyocr]"
tesserocrBinding Tesseract rapide (exige d'abord le Tesseract système, voir ci-dessous)pip install "docling[tesserocr]"
ocrmacOCR Apple Vision — macOS uniquementpip install "docling[ocrmac]"
vlmPipeline de modèles vision-langage (dont Granite Docling)pip install "docling[vlm]"
asrPipeline de reconnaissance vocale (Whisper)pip install "docling[asr]"
htmlrenderRendu de pages HTML pour le backend HTMLpip install "docling[htmlrender]"
feat-ocr-nemotronNVIDIA Nemotron OCR — Linux x86_64 + Python 3.12 + CUDA 13.x uniquementpip install "docling[feat-ocr-nemotron]" --extra-index-url https://download.pytorch.org/whl/cu130 --index-strategy unsafe-best-match
mac_inteltorch épinglé pour Macs Intel (PyTorch ≥2.6 sans wheels Intel)pip install "docling[mac_intel]"

Pour l'OCR : RapidOCR et EasyOCR s'installent par pip seul ; les variantes Tesseract exigent d'abord le binaire système. Comparez les moteurs dans le guide OCR.

6
Step 6

Builds PyTorch : CPU-only, CUDA, MPS, Macs Intel

Les modèles Docling tournent sur PyTorch. Le wheel standard convient à la plupart, trois cas exigent un build spécial :

pip install docling --extra-index-url https://download.pytorch.org/whl/cpu
uv add torch==2.2.2 torchvision==0.17.2 docling
pip install "docling[mac_intel]"
  • Serveurs Linux CPU-only : prenez le petit build CPU plutôt que le gros wheel CUDA (voir commande ci-dessous).
  • GPU NVIDIA sous Linux/Windows : installez un torch compatible CUDA pour votre version CUDA, puis sélectionnez-le avec --device cuda. Sous Windows, WSL2 est le chemin CUDA le plus simple — détails dans le guide Windows.
  • macOS Intel (x86_64) : PyTorch 2.6.0+ ne fournit plus de wheels Intel. Épinglez le dernier build compatible et restez sur Python ≤3.12.
  • Apple Silicon : fonctionne directement ; sélectionnez le backend MPS avec --device mps au besoin (voir guide macOS).
7
Step 7

Paquets système Tesseract + TESSDATA_PREFIX

Nécessaire uniquement avec un moteur Tesseract. Installez le binaire avec le gestionnaire de paquets avant l'extra pip, puis pointez TESSDATA_PREFIX vers les données de langue (avec / final) :

OSInstallationExemple TESSDATA_PREFIX
macOS (Homebrew)brew install tesseract leptonica pkg-config/opt/homebrew/share/tessdata/
Ubuntu / Debiansudo apt-get install tesseract-ocr tesseract-ocr-eng libtesseract-dev libleptonica-dev pkg-configvia dpkg -L tesseract-ocr-eng | grep tessdata$
RHEL / Fedorasudo dnf install tesseract tesseract-devel tesseract-langpack-eng tesseract-osd leptonica-devel/usr/share/tesseract/tessdata/
WindowsInstallez le build UB Mannheim, ajoutez-le au PATHpointez TESSDATA_PREFIX vers son dossier tessdata\\

Si tesserocr refuse de compiler : pip uninstall tesserocr, puis pip install --no-binary :all: tesserocr.

8
Step 8

Vérifiez votre installation

Exécutez ces trois contrôles dans l'ordre — chacun isole une couche de panne différente. Utilisez d'abord un petit PDF numérique (texte) pour écarter OCR et GPU. Essayez ensuite --to json, --to html et --ocr-engine rapidocr. En cas d'échec, voir section 11 ou le dépannage.

docling --help
python -c "import docling; print(docling.__version__)"
docling convert sample.pdf --to md
9
Step 9

Le premier lancement télécharge les modèles — prévoyez-le

docling-tools models download --all
  • La première conversion télécharge les modèles de layout, de tableaux et d'OCR : lent une fois, rapide ensuite.
  • Gardez une connexion stable pour ce premier lancement ; un téléchargement partiel laisse un cache corrompu — relancez simplement.
  • Pré-téléchargez tout :
  • Pointez le cache vers un disque inscriptible avec DOCLING_CACHE_DIR si l'emplacement par défaut est en lecture seule ou trop petit.
  • Machines isolées : téléchargez sur un hôte connecté, puis copiez le répertoire de cache.
10
Step 10

Mettre à jour, épingler et désinstaller

Épinglez une version exacte en production (requirements.txt, lockfile ou tag de conteneur) pour qu'aucun changement de modèle ou de CLI ne vous surprenne. Ce site est vérifié contre la version du badge ci-dessous.

pip install -U docling
pip install "docling==2.129.0"
pip uninstall docling
11
Step 11

Corriger les 5 échecs d'installation les plus fréquents

  • Microsoft Visual C++ 14.0 is required (Windows) : passez à uv add docling pour des wheels précompilées, ou installez les Build Tools via winget install Microsoft.VisualStudio.2022.BuildTools avec la charge C++. Détails dans le guide Windows et le dépannage.
  • Erreurs de version Python : créez un environnement frais en 3.10–3.12 (uv venv --python 3.12). Python 3.9 n'est plus supporté depuis 2.70.0.
  • L'extra OCR échoue : prenez rapidocr ou easyocr (pip seul) ; pour Tesseract, installez d'abord le binaire système + TESSDATA_PREFIX.
  • GPU ignoré (tourne sur CPU) : vérifiez que torch.cuda.is_available() renvoie True, installez un torch CUDA, passez --device cuda (MPS sur Apple Silicon).
  • Mémoire pleine / très lent : convertissez un fichier à la fois, baissez --num-threads, ajoutez --no-ocr pour les PDF numériques.
12
Step 12

FAQ d'installation

Quelle version Python pour Docling ?
Python 3.10 ou plus récent, 64-bit. Le support de 3.9 s'est terminé avec 2.70.0. Sous 3.9 ou en 32-bit, créez un environnement en 3.10–3.12 et réinstallez.
pip ou uv — que choisir ?
Les deux installent le même paquet. uv résout les wheels précompilées plus agressivement, évite l'erreur du compilateur MSVC sous Windows et va plus vite partout. Avec uv : uv add docling, sinon pip install docling suffit.
Faut-il Docker ?
Non pour la conversion locale — le paquet Python suffit. Docker (ou Podman) n'est requis que pour docling-serve, le serveur API HTTP en conteneur. Voir le guide Docker.
Faut-il un GPU ?
Non. Tout tourne sur CPU. Un GPU CUDA (Linux/Windows) ou MPS (Apple Silicon) accélère nettement layout, tableaux et OCR sur les longs documents.
Pourquoi la première conversion est-elle si lente ?
Docling télécharge ses modèles au premier usage. Gardez la connexion pour ce lancement, ou pré-téléchargez avec docling-tools models download --all. Ensuite le cache est réutilisé.
Quel moteur OCR s'installe le plus facilement ?
RapidOCR (docling[rapidocr]) ou EasyOCR (docling[easyocr]) — les deux par pip seul. Tesseract est excellent mais exige binaire système plus données ; OcrMac ne fonctionne que sur macOS.
Installer Docling hors ligne ?
Oui, avec préparation : installez wheels plus cache de modèles sur une machine connectée, puis transférez les deux. Pointez DOCLING_CACHE_DIR vers le cache copié sur l'hôte isolé.
Utiliser Docling avec des frameworks RAG ?
Installez Docling, puis ajoutez l'adaptateur (LangChain, LlamaIndex, Haystack). Convertissez en Markdown ou JSON, puis découpez et indexez. Voir le guide RAG et les exemples.

Vérifié avec Docling v2.129.0 · Dernière vérification 2026-09-22 · Source officielle