LinuxへのDocling導入
Ubuntu/Debian・RHEL/Fedora・WSL2 + Python 3.10以降。先にCPUかCUDAか決定。以降のPyTorch Wheelが定まる。各コマンドは公式インストール文書と照合。
前提 + ディストロ別資材
3.10以降が必要。venvとビルド基盤を導入:
python3 --versionsudo apt-get update && sudo apt-get install -y python3 python3-venv python3-pipRHEL / Fedora:
sudo dnf install -y python3 python3-pippython3 -m venv .venv && source .venv/bin/activate && pip install -U pipCPU専用導入 (サーバー・コンテナ)
既定torch WheelはCUDA同梱で巨大 (2GB超)。CPU専用機では小型CPUビルドを。CI・小規模VPS・CPU Docker像に最適。テキストPDFは十分実用。スキャン・OCR重作業はGPUより遅いのみ。
pip install docling --extra-index-url https://download.pytorch.org/whl/cpuCUDA / GPU導入 (NVIDIA)
pip install doclingpython -c "import torch; print(torch.cuda.is_available())"docling convert report.pdf --device cuda- GPUに合うNVIDIAドライバ + CUDA toolkit導入 (
nvidia-smi確認)。 - pytorch.orgから自CUDA版 (12.8/13.0) のtorch導入後にDocling。または既定索引のCUDA版torch解決後にデバイス指定:
torch.cuda.is_available()がTrue必須。FalseならDocling以前の問題。GPU OCRにはONNX Runtime CUDA経路追加: pip install "docling[onnxruntime]"しCUDAExecutionProviderがort.get_available_providers()にあること。調整 (バッチ・VLMサーバー) は公式GPUガイドへ。
uvのCPU索引設定
uv利用者はpyproject.tomlでtorchをCPU索引に固定。全員・CIが小型Wheelを取得:
uv add docling[[tool.uv.index]]
name = "pytorch-cpu"
url = "https://download.pytorch.org/whl/cpu"
explicit = true
[tool.uv.sources]
torch = [{ index = "pytorch-cpu" }]
Tesseract本体
Tesseract系のみ。本体をpipエクストラより先に導入。TESSDATA_PREFIXは.traineddataフォルダへ (末尾/必須)。Debianはdpkg -L tesseract-ocr-eng | grep tessdata$で特定。RHELは/usr/share/tesseract/tessdata/。tesserocrビルド失敗時はpip uninstall tesserocr後にpip install --no-binary :all: tesserocr。
Debian / Ubuntu:
sudo apt-get install -y tesseract-ocr tesseract-ocr-eng libtesseract-dev libleptonica-dev pkg-configRHEL / Fedoraとバインディング:
sudo dnf install -y tesseract tesseract-devel tesseract-langpack-eng tesseract-osd leptonica-develpip install "docling[tesserocr]"LinuxのOCR・パイプライン系エクストラ
| 用途 | 導入 | 制限 |
|---|---|---|
| RapidOCR (推奨既定) | pip install "docling[rapidocr]" | なし。pipのみ。 |
| EasyOCR | pip install "docling[easyocr]" | なし。pipのみ。 |
| VLMパイプライン | pip install "docling[vlm]" | GPU強推奨。 |
| ASR (音声) | pip install "docling[asr]" | なし。 |
| Nemotron OCR | pip install "docling[feat-ocr-nemotron]" --extra-index-url https://download.pytorch.org/whl/cu130 --index-strategy unsafe-best-match | Linux x86_64 + Python 3.12 + CUDA 13.xのみ。 |
検証 (CPUとGPU)
初回はモデル取得のため接続維持かdocling-tools models download --allで事前取得。比較用に--device cpu強制、NVIDIAは--device cuda。
docling --helpdocling convert sample.pdf --to mddocling convert sample.pdf --device auto --to mdコンテナ派はdocling-serve
CLIでなくHTTP APIが欲しければ公式コンテナ (CPU像を示す)。完全解説はDocker頁:
podman run -p 5001:5001 -e DOCLING_SERVE_ENABLE_UI=1 quay.io/docling-project/docling-serve-cpuLinux頻出問題
Linux FAQ
CPU版とCUDA版torchどちら?
/whl/cpu索引 (小型・高速取得)。速度が欲しいNVIDIA機はCUDA版torch + --device cuda。CUDA版はどれ?
nvidia-smi)。docling-serveは-cu128・-cu130像を発行。pipはpytorch.org推奨索引を選択。Nemotron OCRは使える?
feat-ocr-nemotronエクストラ + cu130索引 + unsafe-best-match方針で導入。Tesseractはaptとpipどちら?
tesserocr) はpip。後にTESSDATA_PREFIX設定。Docling v2.129.0で検証 · 最終確認 2026-09-22 · 公式ソース