Docling unter Linux installieren
Ubuntu / Debian, RHEL / Fedora und WSL2 mit Python 3.10+. Zuerst den CPU- oder CUDA-Pfad wählen — er entscheidet, welches PyTorch-Wheel installiert wird. Jeden Befehl mit der offiziellen Installationsdokumentation abgleichen.
Voraussetzungen + Distro-Pakete
3.10+ wird benötigt. Dann venv + Build-Grundlagen installieren:
python3 --versionsudo apt-get update && sudo apt-get install -y python3 python3-venv python3-pipRHEL / Fedora:
sudo dnf install -y python3 python3-pippython3 -m venv .venv && source .venv/bin/activate && pip install -U pipCPU-only-Installation (Server, Container)
Das Standard-torch-Wheel bündelt CUDA-Bibliotheken (2 GB+). Auf CPU-only-Rechnern stattdessen das kleine CPU-Build installieren. Die richtige Wahl für CI-Runner, kleine VPS-Instanzen und CPU-Docker-Images. Für Text-PDFs voll brauchbar; Scan-/OCR-lastiges ist nur langsamer als auf GPU.
pip install docling --extra-index-url https://download.pytorch.org/whl/cpuCUDA-/GPU-Installation (NVIDIA)
pip install doclingpython -c "import torch; print(torch.cuda.is_available())"docling convert report.pdf --device cuda- NVIDIA-Treiber + CUDA-Toolkit passend zur GPU installieren (
nvidia-smiprüfen). - CUDA-fähiges torch von pytorch.org für die eigene CUDA-Version (12.8 / 13.0) installieren, dann Docling — oder CUDA-torch aus dem Standard-Index auflösen lassen, dann das Gerät wählen:
torch.cuda.is_available() muss True ausgeben — sonst erst Treiber/torch reparieren, bevor Docling-Flags justiert werden. Für GPU-OCR den ONNX-Runtime-CUDA-Pfad ergänzen: pip install "docling[onnxruntime]" und prüfen, dass CUDAExecutionProvider in ort.get_available_providers() erscheint. Feintuning (Batch-Größen, VLM-Server) steht in der offiziellen GPU-Anleitung.
uv-CPU-Index-Konfiguration
uv-Nutzer pinnen torch in pyproject.toml auf den CPU-Index, damit jedes Teammitglied und jeder CI-Lauf das kleine Wheel bekommt:
uv add docling[[tool.uv.index]]
name = "pytorch-cpu"
url = "https://download.pytorch.org/whl/cpu"
explicit = true
[tool.uv.sources]
torch = [{ index = "pytorch-cpu" }]
Tesseract-Systempakete
Nur für Tesseract-Engines. Binärdatei vor dem pip-Extra installieren. TESSDATA_PREFIX auf den Ordner mit .traineddata zeigen lassen (muss mit / enden). Unter Debian via dpkg -L tesseract-ocr-eng | grep tessdata$ finden, unter RHEL /usr/share/tesseract/tessdata/ nutzen. Scheitert der tesserocr-Bau: pip uninstall tesserocr, dann pip install --no-binary :all: tesserocr.
Debian / Ubuntu:
sudo apt-get install -y tesseract-ocr tesseract-ocr-eng libtesseract-dev libleptonica-dev pkg-configRHEL / Fedora, danach das Binding:
sudo dnf install -y tesseract tesseract-devel tesseract-langpack-eng tesseract-osd leptonica-develpip install "docling[tesserocr]"OCR- und Pipeline-Extras unter Linux
| Bedarf | Installation | Einschränkung |
|---|---|---|
| RapidOCR (empfohlener Standard) | pip install "docling[rapidocr]" | Keine — nur pip. |
| EasyOCR | pip install "docling[easyocr]" | Keine — nur pip. |
| VLM-Pipeline | pip install "docling[vlm]" | GPU dringend empfohlen. |
| ASR (Audio) | pip install "docling[asr]" | Keine. |
| Nemotron OCR | pip install "docling[feat-ocr-nemotron]" --extra-index-url https://download.pytorch.org/whl/cu130 --index-strategy unsafe-best-match | Nur Linux x86_64 + Python 3.12 + CUDA 13.x. |
Verifikation (CPU vs. GPU)
Erster Lauf lädt Modelle — Verbindung halten oder mit docling-tools models download --all vorab laden. Zum Vergleich --device cpu für CPU erzwingen, --device cuda für NVIDIA.
docling --helpdocling convert sample.pdf --to mddocling convert sample.pdf --device auto --to mdLieber Container? docling-serve nutzen
Für eine HTTP-API statt CLI den offiziellen Container nehmen (CPU-Image gezeigt) — Referenz in der Docker-Seite:
podman run -p 5001:5001 -e DOCLING_SERVE_ENABLE_UI=1 quay.io/docling-project/docling-serve-cpuHäufige Linux-Probleme
- GPU ignoriert — siehe GPU wird nicht genutzt: falscher torch-Build oder fehlende Treiber.
- Speicher voll — siehe Speicher voll: Dateien einzeln umwandeln,
--num-threadssenken,--no-ocrfür digitale PDFs. - Riesige Installationsgröße — CUDA-torch auf CPU-Rechner gezogen; mit der
--extra-index-url …/cpu-Zeile neu installieren. - Tesseract fehlen Sprachen —
tesseract-ocr-lang-Pakete installieren undTESSDATA_PREFIXexportieren. - Berechtigungsfehler — venv nutzen; niemals
sudo pip install.
Linux-FAQ
CPU- oder CUDA-torch?
/whl/cpu-Index (klein, schneller Download). Jeder NVIDIA-Rechner mit Tempowunsch: CUDA-fähiges torch plus --device cuda.Welche CUDA-Version?
nvidia-smi prüfen). docling-serve veröffentlicht -cu128- und -cu130-Images; für pip-Installationen den torch-Index nehmen, den pytorch.org für dieses CUDA empfiehlt.Kann ich Nemotron OCR nutzen?
feat-ocr-nemotron-Extra plus cu130-Index und unsafe-best-match-Strategie.apt oder pip für Tesseract?
tesserocr) aus pip. Danach TESSDATA_PREFIX setzen.Verifiziert mit Docling v2.129.0 · Zuletzt geprüft 2026-09-22 · Offizielle Quelle