Docling 轻松将复杂 PDF、Office 文档、扫描图像和音频转换为高质量的结构化 Markdown 和 JSON。完美支持大语言模型、RAG 和 AI Agent 工作流。
Docling 是由 IBM Research 开发并在 LF AI & Data 基金会开源的文档解析引擎。支持通过 Granite Docling 视觉模型和 TableFormer 将 PDF、Word(DOCX)、PPT(PPTX)、Excel(XLSX)、HTML 及音频精准转换为结构化 Markdown 与 JSON。
将非结构化文档直接转换为 LLM 友好的高质量数据所需的一切工具。
统一 API 解析 PDF、DOCX、PPTX、XLSX、HTML、EPUB、LaTeX、CSV、音频(WAV/MP3)及专利 XML(USPTO/JATS)。
自动识别多栏排版、侧边栏、页眉页脚与视线阅读流向。
先进的表格还原模型,高精度识别复杂跨行跨列合并单元格与无边框财务报表。
灵活选择 RapidOCR、Tesseract、EasyOCR、OcrMac 或 Nemotron OCR 处理扫描文档。
基于文档节点切分,完美保留标题层级、表格矩阵及空间坐标元数据。
导出结构化 Markdown、JSON 与 DocTags,原生适配 LangChain、LlamaIndex、Haystack 与 MCP 协议。
Docling 完美支持在 Windows (64-bit)、macOS (Apple Silicon 及 Intel) 和 Linux 上本地运行。
了解 Docling 与传统提取工具在性能与功能上的核心差异。
相比于仅能提取无序纯文本的 PyPDF 和 pdfplumber,Docling 具备先进的版面视觉理解与 TableFormer 表格还原。相较于 Unstructured.io,Docling 100% 本地免费运行,无需绑定收费云端 API。
| 核心能力 / 指标 | Docling (v2.115) | Unstructured.io | PyPDF / pdfplumber | Marker |
|---|---|---|---|---|
| 复杂 PDF 版面几何理解 | ||||
| 跨行合并表格还原 (TableFormer) | 部分支持 / 收费 API | 简易网格 | ||
| 音视频语音转录 (ASR) | (Whisper) | |||
| MCP Agent 协议原生支持 | (原生集成) | |||
| 100% 免费开源协议 (MIT) | Apache 2.0 / 商业闭源 | BSD / MIT | GPL v3 / 商业版 |
即拷即用的命令行指令集。
转换本地 PDF 文件并直接输出为 Markdown 文本。
docling report.pdf --to md
无需预先下载,直接通过 HTTP 链接解析线上文档。
docling https://arxiv.org/pdf/2408.09869
对扫描版或混合版 PDF 强制运行全页 OCR。
docling scan.pdf --ocr-mode full_page
输出包含 Bounding Box 的无损 DoclingDocument JSON。
docling document.pdf --to json
调用专用模型精准还原 LaTeX 公式与代码片段。
docling paper.pdf --enrich-code --enrich-formula
将 MP3 或 WAV 音频转录为结构化文本。
docling lecture.mp3 --pipeline asr --to md
将版面及表格模型提前缓存至本地以供离线使用。
docling-tools models download --all
启动 MCP 协议服务以连接 Claude Desktop 与智能体。
uvx --from=docling-mcp docling-mcp-server
自由组合参数,实时生成可执行的命令行与 Python SDK 脚本。
关于安装配置、多语言OCR、离线隐私安全及性能加速的解答。
uv(uv add docling),直接拉取预编译 Wheel,无需 C++ 编译器。
pipeline_options.do_ocr = False 或在命令行使用 --no-ocr,转换速度可提升 5 到 10 倍。
.xlsx)的多工作表提取为 Markdown/HTML 表格,并解析 PowerPoint(.pptx)的幻灯片层级与备注。