IBM Research & LF AI & Data 开源项目

Docling: 专为 AI 打造的超快 文档解析 引擎

Docling 轻松将复杂 PDF、Office 文档、扫描图像和音频转换为高质量的结构化 Markdown 和 JSON。完美支持大语言模型、RAG 和 AI Agent 工作流。

bash — 快速体验
$pip install docling
$docling https://arxiv.org/pdf/2408.09869 --to md

Docling 是什么?

Docling 是由 IBM Research 开发并在 LF AI & Data 基金会开源的文档解析引擎。支持通过 Granite Docling 视觉模型和 TableFormer 将 PDF、Word(DOCX)、PPT(PPTX)、Excel(XLSX)、HTML 及音频精准转换为结构化 Markdown 与 JSON。

专为大模型与现代数据工程设计

将非结构化文档直接转换为 LLM 友好的高质量数据所需的一切工具。

多模态文档深度解析

统一 API 解析 PDF、DOCX、PPTX、XLSX、HTML、EPUB、LaTeX、CSV、音频(WAV/MP3)及专利 XML(USPTO/JATS)。

PDFDOCXPPTXXLSXAudio (ASR)

版面分析与阅读顺序

自动识别多栏排版、侧边栏、页眉页脚与视线阅读流向。

多栏排版Bounding Boxes

TableFormer 表格还原

先进的表格还原模型,高精度识别复杂跨行跨列合并单元格与无边框财务报表。

TableFormer v2HTML 表格

可插拔式 OCR 引擎

灵活选择 RapidOCR、Tesseract、EasyOCR、OcrMac 或 Nemotron OCR 处理扫描文档。

RapidOCRTesseractEasyOCR

RAG 结构化分块 (`HybridChunker`)

基于文档节点切分,完美保留标题层级、表格矩阵及空间坐标元数据。

HybridChunker向量数据库

DoclingDocument 与 AI 生态

导出结构化 Markdown、JSON 与 DocTags,原生适配 LangChain、LlamaIndex、Haystack 与 MCP 协议。

LangChainLlamaIndexMCP Serverdocling-serve

选择适合您的平台安装 Docling

Docling 完美支持在 Windows (64-bit)、macOS (Apple Silicon 及 Intel) 和 Linux 上本地运行。

通过 pip 安装
$pip install docling
# 扩展组件: pip install "docling[rapidocr,tesserocr,vlm,asr]"
通过 Astral uv 安装
$uv add docling
Windows 10 / 11 PowerShell(64位 Python)
# 方案 A(强烈推荐):通过 uv 下载预编译二进制,无需 C++ 编译器
PS>uv add docling
# 方案 B:pip 安装(编译 tesserocr 等扩展时需 Visual C++ 14.0+ 生成工具)
PS>pip install docling
Docker 容器运行
$docker run -it --rm -v $(pwd):/docs quay.io/ds4sd/docling:latest docling /docs/sample.pdf
Claude Desktop & LM Studio MCP 服务
uvx --from=docling-mcp docling-mcp-server
macOS Intel x86_64
$pip install "docling[mac_intel]"
Linux PyTorch 纯 CPU 版
$pip install docling --extra-index-url https://download.pytorch.org/whl/cpu

Docling 与同类产品对比

了解 Docling 与传统提取工具在性能与功能上的核心差异。

相比于仅能提取无序纯文本的 PyPDFpdfplumberDocling 具备先进的版面视觉理解与 TableFormer 表格还原。相较于 Unstructured.io,Docling 100% 本地免费运行,无需绑定收费云端 API。

核心能力 / 指标 Docling (v2.115) Unstructured.io PyPDF / pdfplumber Marker
复杂 PDF 版面几何理解
跨行合并表格还原 (TableFormer) 部分支持 / 收费 API 简易网格
音视频语音转录 (ASR) (Whisper)
MCP Agent 协议原生支持 (原生集成)
100% 免费开源协议 (MIT) Apache 2.0 / 商业闭源 BSD / MIT GPL v3 / 商业版

CLI 常用命令速查

即拷即用的命令行指令集。

单份 PDF 转 Markdown

转换本地 PDF 文件并直接输出为 Markdown 文本。

docling report.pdf --to md
直接解析网络 URL 文档

无需预先下载,直接通过 HTTP 链接解析线上文档。

docling https://arxiv.org/pdf/2408.09869
强制全页 OCR 识别

对扫描版或混合版 PDF 强制运行全页 OCR。

docling scan.pdf --ocr-mode full_page
导出包含坐标的 JSON

输出包含 Bounding Box 的无损 DoclingDocument JSON。

docling document.pdf --to json
开启公式与代码块提取

调用专用模型精准还原 LaTeX 公式与代码片段。

docling paper.pdf --enrich-code --enrich-formula
音视频语音文字转录

将 MP3 或 WAV 音频转录为结构化文本。

docling lecture.mp3 --pipeline asr --to md
预下载所有本地模型

将版面及表格模型提前缓存至本地以供离线使用。

docling-tools models download --all
启动 MCP 服务

启动 MCP 协议服务以连接 Claude Desktop 与智能体。

uvx --from=docling-mcp docling-mcp-server

CLI 与 Python 配置代码生成器

自由组合参数,实时生成可执行的命令行与 Python SDK 脚本。

启用 OCR 引擎
富化提取代码块
富化提取 LaTeX 公式

CLI 命令行执行输出

docling bash

              

等效 Python SDK 代码

docling python

              

常见问题解答 (FAQ)

关于安装配置、多语言OCR、离线隐私安全及性能加速的解答。

Docling 是什么?有哪些核心功能?
Docling 是由 IBM Research 开发并在 LF AI & Data 基金会开源的文档解析引擎。能够将复杂 PDF、Office 文档(Word、Excel、PowerPoint)、网页和音频解析并转换为结构化 Markdown 与 JSON,专为大模型 RAG 管道优化。
Docling 是否完全免费且可商用?
是的,Docling 采用极度宽松的 MIT 协议,完全免费开源,可无限制用于个人、学术及商业项目。
Docling 是否会将文档数据上传到外部云服务器?
绝不。Docling 100% 在本地或私有算力中运行,不依赖任何外部云 API,绝不上传文档数据或遥测信息,完全支持物理隔绝网络(Air-Gapped)环境。
在 Windows 上使用是否必须安装 C++ 编译工具?
Windows 需使用 64 位 Python。若通过 pip 编译本地扩展需要 Visual C++ 14.0+。推荐使用 Astral uvuv add docling),直接拉取预编译 Wheel,无需 C++ 编译器。
如何禁用 OCR 以大幅提升数字 PDF 转换速度?
对于有文本层的电子 PDF,在 Python 中配置 pipeline_options.do_ocr = False 或在命令行使用 --no-ocr,转换速度可提升 5 到 10 倍。
Docling 是否支持解析 Excel(.xlsx)和 PowerPoint(.pptx)?
支持。Docling 可将 Excel(.xlsx)的多工作表提取为 Markdown/HTML 表格,并解析 PowerPoint(.pptx)的幻灯片层级与备注。