TableFormer、可插拔 OCR、DoclingDocument JSON、MIT 本地许可的文档理解。比纯提取慢,安装较重(模型约 500MB)。安装 →
Docling vs 替代方案
没有通用冠军,只有与你的文档、硬件、许可和 RAG 架构最适配的选择。TL;DR 如下,证据在矩阵中。
已用 Docling v2.129.0 验证 · 最近检查 2026-09-22 · 独立运营,无付费排名。
本地 RAG 的混合 PDF → Docling。GPU 上的论文、公式与 CJK → MinerU。企业多格式 ETL → Unstructured。海量干净 PDF 求极速 → PyMuPDF(+表格用 pdfplumber)。书籍与扫描文本 → Marker。免运维托管解析 → LlamaParse。权衡见下文。
谁该选什么?
最广格式覆盖(60+),partition + chunk_by_title,加付费云 API。hi_res 质量需要搭建与 GPU,最佳功能向商业版迁移。
最快的文本提取(约0.01秒/页),网格表格精准。无版式模型、无 OCR,PyMuPDF 为 AGPL,扫描件会静默输出空结果。
Surya 2 + LaTeX 公式的精美 Markdown。Marker 2 fast 模式可跑 CPU、GPU 上最佳;Apache-2.0 代码附权重上限;无框业务表格偏弱。
DocLayout-YOLO 版式 SOTA、UniMERNet 公式与最强 CJK。需 GPU、安装笨重、Apache 系许可附商业阈值,论文与公式之选。
三问给出起点
回答三个问题获得起点,再用矩阵验证。
完整对比矩阵
按采购真实问题分组。? 显示定义,每个工具名链向官方文档。用筛选与差异开关降噪。
| 功能 | Docling | Unstructured | PyMuPDF / pdfplumber | Marker | MinerU |
|---|---|---|---|---|---|
| 文档理解是还原顺序、版式与表格,还是只导出文本。 | |||||
| 版式与阅读顺序 ? | Yes | Partial (hi_res) | No | Yes | Yes (DocLayout-YOLO) |
| 表格结构 ? | Yes (TableFormer) | Partial / paid tiers | Basic grid | Yes | Yes (TableMaster + merge) |
| 公式与数学 ? | Enrichment pass | Partial | No | Yes (Surya 2) | Best (UniMERNet LaTeX) |
| 多栏版式 ? | Yes | Partial | No | Best-in-class | Yes |
| 页眉页脚过滤 ? | Yes | Yes | Manual | Partial | Yes (auto) |
| 文本提取与 OCR数字 PDF 要速度,扫描件要 OCR,没有全能引擎。 | |||||
| 原生文本速度 ? | Medium (~0.3–3 s/pg) | Fast / hi_res medium | Fastest (~0.01 s/pg) | Fast (CPU ok) | Slow (GPU-bound) |
| 扫描件 OCR ? | Yes (pluggable) | Yes | No (needs Tesseract) | Yes (Surya 2) | Yes (PaddleOCR) |
| OCR 引擎选择 ? | 6+ engines | Tesseract / Paddle | External only | Built-in (Surya 2) | Built-in (PP-OCRv6) |
| CJK 与复杂文字 ? | Good | Good | Basic | Good | Best-in-class |
| 输入与输出输入(格式)与面向 LLM 的输出(Markdown、JSON、分块)。 | |||||
| 输入格式 ? | 20+ formats | 60+ formats | PDF-centric | PDF + books | PDF + Office + EPUB |
| Markdown 输出 ? | Yes | Yes | Via pymupdf4llm | Yes | Yes |
| 结构化 JSON ? | Yes (DoclingDocument) | Yes (Elements) | No | Partial | Yes (content list) |
| 可分块结构 ? | Yes | Yes (chunk_by_title) | No | Yes (--output chunks) | Partial |
| 部署与运维运行位置、硬件需求与运维成本。 | |||||
| 本地/离线运行 ? | Yes | Partial (API push) | Yes | Yes | Yes |
| 硬件需求 ? | CPU ok, GPU faster | CPU ok, GPU for hi_res | CPU only | CPU ok, GPU for best | GPU needed (4–8 GB) |
| 安装体积 ? | ~500 MB models | Heavy (Detectron2) | Light (~20 MB) | Medium–heavy | Heavy |
| 许可证 ? | MIT | Apache 2.0 + commercial | PyMuPDF: AGPL / pdfplumber: MIT | Apache-2.0 + weight cap | Apache-based + thresholds |
| AI/RAG 适配面向生产 RAG 的连接器、智能体与多模态输入。 | |||||
| RAG 集成 ? | Yes | Yes | No | Partial | Partial |
| 智能体/MCP 服务 ? | Yes | No | No | No | No |
| 音频/视频(ASR) ? | Yes | No | No | No | No |
| 云 API 选项 ? | Self-host | Yes (paid) | No | Yes (Datalab API) | No (opt-in remote) |
| 成本与信任单页价格、治理归属与主张验证方法。 | |||||
| 自托管成本 ? | Free (MIT) | Free OSS / paid API | Free / licence terms apply | Free within weight cap | Free within thresholds |
| 治理归属 ? | Linux Foundation AI | Unstructured.io | MuPDF / community | Datalab | OpenDataLab / SAI Lab |
| 最适合 ? | Accurate local RAG | Multi-format ETL | Fast text extract | Books & papers | Papers, math & CJK |
为选型参考而非基准测试。精度数字来自 200–500 PDF 独立研究(见方法)。决策前请以官方文档复核,版本变化很快。
诚实的一对一
Docling 赢在哪、输在哪、何时切换,一一说明。
Docling vs Unstructured
官方文档经验:以 PDF 为主的自建 RAG → Docling。异构 ETL(SharePoint、S3、60+ 格式)→ Unstructured。
优势(Unstructured)
- 60+ 输入格式与云连接器
- chunk_by_title 结构化切分
- 带编排的托管 API
短板
- hi_res 需要 Detectron2/GPU 与搭建
- 最佳功能向付费迁移
- 本地 OSS 弱于云 API
结论:PDF 为主的自建 RAG 选 Docling。格式动物园要托管运营,选 Unstructured 并预留 API 预算。
Docling vs PyMuPDF / pdfplumber
官方文档经验:已知干净的海量数字 PDF → PyMuPDF。其余 → 前面加 Docling。
优势(PyMuPDF)
- 约0.01秒/页,比 ML 流水线快 10–50 倍
- 安装极小,处处可跑
- pdfplumber 在网格表格上很强
短板
- 无版式模型与阅读顺序
- 无 OCR,扫描件输出为空
- 注意 PyMuPDF 的 AGPL 条款
结论:唯速度且 PDF 干净,选 PyMuPDF。一旦出现表格、分栏或扫描,Docling 的投入就值。
Docling vs Marker
官方仓库经验:CPU 本地的业务表格 → Docling。CPU 可跑/GPU 上的书籍与扫描文本 → Marker 2。
优势(Marker)
- 多栏阅读顺序最强
- Surya 2 OCR + LaTeX 公式
- 书籍的干净 Markdown;fast 模式可跑 CPU
短板
- 最高质量仍需 GPU(balanced 模式)
- 中重型安装
- Apache-2.0 代码但权重有上限(约$5M);无框表格偏弱
结论:200 PDF 独立测试中表格 Docling 领先(TEDS 约0.89对0.81),阅读顺序 Marker 领先,看场景定。
Docling vs MinerU
官方文档经验:CPU 本地的业务表格 → Docling。GPU 上的论文、公式与 CJK → MinerU。
优势(MinerU)
- 版式 SOTA(宣称 97.5 mAP)的 DocLayout-YOLO
- UniMERNet 公式、跨页表格合并
- 最强 CJK
短板
- 需 GPU(4–8GB),单页流水线慢
- 安装笨重;表格输出为 HTML
- Apache 系许可附商业阈值与署名义务
结论:版式与公式 MinerU 领先,类型化文档、CPU 友好与许可简明 Docling 领先。按语料路由:论文走 MinerU,业务走 Docling。
Docling vs MarkItDown
官方文档经验:受限环境中的简单 PDF + Office 混合 → MarkItDown。结构、表格或 OCR → Docling。
优势(MarkItDown)
- MIT、约80MB、单文档一秒内
- 格式覆盖极广(Office、HTML、音频、EPUB)
- 可选 Azure 文档 OCR 后端
短板
- pdfminer 内核:无版式模型、表格错乱
- 分栏串行;默认无 OCR
- OCR 需 LLM 插件或付费 Azure 页面
结论:把 MarkItDown 留作 Office/高速通道:它是转换器,不是文档理解的替代品。
Docling vs LlamaParse
Docling 文档经验:LlamaIndex 技术栈、非涉密、中等体量 → LlamaParse。涉密、离线或海量 → 自托管 Docling。
优势(LlamaParse)
- 分级模式(Fast 到 Agentic Plus)可锁定版本
- 复杂版式精度强;免费额度慷慨
- 零运维;LlamaIndex 原生集成
短板
- 按页计费(约 $0.003–0.01),线性增长
- 数据离境;闭源
- SDK 迁移中;无公开基准透明度
结论:为省心付费,而非为独占付费:2026 年基准显示小型开放 VLM 在单卡上已持平。Mistral OCR、Reducto、Extend 与大厂 API(Azure、Textract、Google)同属托管路线:对比单页价、数据出境与锁定。
同一任务,四种工具
每种工具做 PDF → Markdown。复制运行,感受搭建与输出的差别。
docling convert report.pdf --to md --ocr-engine rapidocr一条命令完成版式+表格+OCR 的本地流水线。
from unstructured.partition.pdf import partition_pdf
elements = partition_pdf('report.pdf', strategy='hi_res')hi_res 需要版式模型,fast 策略弱得多。
import fitz
doc = fitz.open('report.pdf')
text = '\n'.join(p.get_text() for p in doc)极快,但扫描页会静默输出空结果。
marker_single report.pdf --output_dir out/Marker 2 fast 模式可跑 CPU,最高质量在 GPU。
mineru -p report.pdf -o ./out需 GPU;表格输出 HTML,公式输出 LaTeX。
markitdown report.pdf -o report.md极快极小,但无版式模型、默认无 OCR。
本页如何构建
依据:官方文档(Docling、Unstructured、PyMuPDF、Marker 仓库)加独立基准:200 PDF 对比(表格 TEDS、阅读顺序)与 500 PDF 企业研究(表格、分栏、OCR、速度)。要点:表格 Docling 领先(约97.9%/TEDS约0.89),阅读顺序与 GPU 速度 Marker 领先,原始速度 PyMuPDF 领先。
诚实规则:无付费排名,列出对手优势,版本(Docling v2.129.0、检查 2026-09-22)置顶。修正经 GitHub,以官方来源复核。
许可 2026 年复核:Marker 2 代码为 Apache-2.0(权重有上限),MinerU 使用附商业阈值的 Apache 系许可。