DoclingはPDF、Office文書、画像、音声を高精度に解析し、構造化MarkdownやJSONを出力します。生成AI、RAG、AIエージェントの入力パイプラインに最適です。
DoclingはIBM Researchが開発したオープンソースの文書解析エンジンです。PDF、Word(DOCX)、PowerPoint(PPTX)、Excel(XLSX)、HTML、画像、音声を、Granite DoclingとTableFormerによってAI・RAG向けの構造化MarkdownやJSONに変換します。
ドキュメントをLLM向けの整った構造化データに変換するすべての機能を搭載。
PDF、DOCX、PPTX、XLSX、HTML、EPUB、LaTeX、CSV、音声(WAV/MP3)、特許XML(USPTO/JATS)を統一APIで解析。
複数段組レイアウト、サイドバー、ヘッダー/フッター、視覚的階層を自動判定。
結合セルや罫線のない複雑な財務諸表を高精度にHTML/Markdownテーブルへ復元。
EasyOCR、Tesseract、RapidOCR、OcrMac、Nemotron OCRを選択してスキャン文書を解析。
見出し階層や表構造を維持した構造ベースのチャンキングで高精度な検索を実現。
Markdown、JSON、DocTagsへの出力と、LangChain、LlamaIndex、Haystack、MCPサーバーとのシームレスな統合。
DoclingはWindows(64-bit)、macOS(Apple Silicon & Intel)、Linuxでローカル実行可能です。
主要なドキュメント変換・解析ツールとの機能比較。
テキスト抽出のみの PyPDF や pdfplumber と異なり、Docling は高度なレイアウト解析と TableFormer による表復元を行います。Unstructured.io と比較しても、Docling は完全ローカルで動作し、追加の有料APIを必要としません。
| 機能 / 指標 | Docling (v2.115) | Unstructured.io | PyPDF / pdfplumber | Marker |
|---|---|---|---|---|
| 複雑なPDFレイアウト解析 | ||||
| 表構造認識 (TableFormer) | 一部 / 有料API | 簡易格子のみ | ||
| 音声・動画文字起こし (ASR) | (Whisper) | |||
| MCPサーバー連携 | (ネイティブ) | |||
| 100% 完全無料オープンソース (MIT) | Apache 2.0 / 商用 | BSD / MIT | GPL v3 / 商用 |
コピーしてすぐに使える主要CLIコマンド集。
ローカルのPDFファイルをMarkdown形式に直接変換します。
docling report.pdf --to md
オンラインのドキュメントURLを指定してダウンロード&解析。
docling https://arxiv.org/pdf/2408.09869
スキャンPDFなどの全ページに対してOCRを実行。
docling scan.pdf --ocr-mode full_page
バウンディングボックスを含む完全なJSON構造を出力。
docling document.pdf --to json
LaTeX数式やソースコードを専門モデルで抽出・整形。
docling paper.pdf --enrich-code --enrich-formula
MP3やWAV音声を構造化テキストに変換。
docling lecture.mp3 --pipeline asr --to md
オフライン利用のためにモデルをローカルキャッシュへ事前取得。
docling-tools models download --all
Claude Desktop等と接続するためのMCPサーバーを起動。
uvx --from=docling-mcp docling-mcp-server
オプションを選択すると、実行可能なコマンドとPythonコードをリアルタイム生成します。
導入、OCR設定、オフライン利用、高速化に関する解説。
uv(uv add docling)を使用すると事前ビルド済みバイナリが取得されコンパイラ不要で導入できます。
pipeline_options.do_ocr = FalseまたはCLIで--no-ocrを指定することで、処理を5〜10倍高速化できます。
.xlsx)のシート別Markdown/HTML表変換や、PowerPoint(.pptx)のスライド階層・発表者ノートの抽出に対応しています。