Docling vs 替代方案

没有通用冠军,只有与你的文档、硬件、许可和 RAG 架构最适配的选择。TL;DR 如下,证据在矩阵中。

已用 Docling v2.129.0 验证 · 最近检查 2026-09-22 · 独立运营,无付费排名。

TL;DR

本地 RAG 的混合 PDF → Docling。GPU 上的论文、公式与 CJK → MinerU。企业多格式 ETL → Unstructured。海量干净 PDF 求极速 → PyMuPDF(+表格用 pdfplumber)。书籍与扫描文本 → Marker。免运维托管解析 → LlamaParse。权衡见下文。

1
结论

谁该选什么?

Docling本站重点

TableFormer、可插拔 OCR、DoclingDocument JSON、MIT 本地许可的文档理解。比纯提取慢,安装较重(模型约 500MB)。安装 →

Unstructured

最广格式覆盖(60+),partition + chunk_by_title,加付费云 API。hi_res 质量需要搭建与 GPU,最佳功能向商业版迁移。

PyMuPDF / pdfplumber

最快的文本提取(约0.01秒/页),网格表格精准。无版式模型、无 OCR,PyMuPDF 为 AGPL,扫描件会静默输出空结果。

Marker

Surya 2 + LaTeX 公式的精美 Markdown。Marker 2 fast 模式可跑 CPU、GPU 上最佳;Apache-2.0 代码附权重上限;无框业务表格偏弱。

MinerU

DocLayout-YOLO 版式 SOTA、UniMERNet 公式与最强 CJK。需 GPU、安装笨重、Apache 系许可附商业阈值,论文与公式之选。

2
查找器

三问给出起点

回答三个问题获得起点,再用矩阵验证。

在上方选择,这里将显示带理由的推荐。
3
矩阵

完整对比矩阵

按采购真实问题分组。? 显示定义,每个工具名链向官方文档。用筛选与差异开关降噪。

功能DoclingUnstructuredPyMuPDF / pdfplumberMarkerMinerU
文档理解是还原顺序、版式与表格,还是只导出文本。
版式与阅读顺序 ?YesPartial (hi_res)NoYesYes (DocLayout-YOLO)
表格结构 ?Yes (TableFormer)Partial / paid tiersBasic gridYesYes (TableMaster + merge)
公式与数学 ?Enrichment passPartialNoYes (Surya 2)Best (UniMERNet LaTeX)
多栏版式 ?YesPartialNoBest-in-classYes
页眉页脚过滤 ?YesYesManualPartialYes (auto)
文本提取与 OCR数字 PDF 要速度,扫描件要 OCR,没有全能引擎。
原生文本速度 ?Medium (~0.3–3 s/pg)Fast / hi_res mediumFastest (~0.01 s/pg)Fast (CPU ok)Slow (GPU-bound)
扫描件 OCR ?Yes (pluggable)YesNo (needs Tesseract)Yes (Surya 2)Yes (PaddleOCR)
OCR 引擎选择 ?6+ enginesTesseract / PaddleExternal onlyBuilt-in (Surya 2)Built-in (PP-OCRv6)
CJK 与复杂文字 ?GoodGoodBasicGoodBest-in-class
输入与输出输入(格式)与面向 LLM 的输出(Markdown、JSON、分块)。
输入格式 ?20+ formats60+ formatsPDF-centricPDF + booksPDF + Office + EPUB
Markdown 输出 ?YesYesVia pymupdf4llmYesYes
结构化 JSON ?Yes (DoclingDocument)Yes (Elements)NoPartialYes (content list)
可分块结构 ?YesYes (chunk_by_title)NoYes (--output chunks)Partial
部署与运维运行位置、硬件需求与运维成本。
本地/离线运行 ?YesPartial (API push)YesYesYes
硬件需求 ?CPU ok, GPU fasterCPU ok, GPU for hi_resCPU onlyCPU ok, GPU for bestGPU needed (4–8 GB)
安装体积 ?~500 MB modelsHeavy (Detectron2)Light (~20 MB)Medium–heavyHeavy
许可证 ?MITApache 2.0 + commercialPyMuPDF: AGPL / pdfplumber: MITApache-2.0 + weight capApache-based + thresholds
AI/RAG 适配面向生产 RAG 的连接器、智能体与多模态输入。
RAG 集成 ?YesYesNoPartialPartial
智能体/MCP 服务 ?YesNoNoNoNo
音频/视频(ASR) ?YesNoNoNoNo
云 API 选项 ?Self-hostYes (paid)NoYes (Datalab API)No (opt-in remote)
成本与信任单页价格、治理归属与主张验证方法。
自托管成本 ?Free (MIT)Free OSS / paid APIFree / licence terms applyFree within weight capFree within thresholds
治理归属 ?Linux Foundation AIUnstructured.ioMuPDF / communityDatalabOpenDataLab / SAI Lab
最适合 ?Accurate local RAGMulti-format ETLFast text extractBooks & papersPapers, math & CJK

为选型参考而非基准测试。精度数字来自 200–500 PDF 独立研究(见方法)。决策前请以官方文档复核,版本变化很快。

4
对决

诚实的一对一

Docling 赢在哪、输在哪、何时切换,一一说明。

Docling vs Unstructured

官方文档

经验:以 PDF 为主的自建 RAG → Docling。异构 ETL(SharePoint、S3、60+ 格式)→ Unstructured。

优势(Unstructured)

  • 60+ 输入格式与云连接器
  • chunk_by_title 结构化切分
  • 带编排的托管 API

短板

  • hi_res 需要 Detectron2/GPU 与搭建
  • 最佳功能向付费迁移
  • 本地 OSS 弱于云 API

结论:PDF 为主的自建 RAG 选 Docling。格式动物园要托管运营,选 Unstructured 并预留 API 预算。

Docling vs PyMuPDF / pdfplumber

官方文档

经验:已知干净的海量数字 PDF → PyMuPDF。其余 → 前面加 Docling。

优势(PyMuPDF)

  • 约0.01秒/页,比 ML 流水线快 10–50 倍
  • 安装极小,处处可跑
  • pdfplumber 在网格表格上很强

短板

  • 无版式模型与阅读顺序
  • 无 OCR,扫描件输出为空
  • 注意 PyMuPDF 的 AGPL 条款

结论:唯速度且 PDF 干净,选 PyMuPDF。一旦出现表格、分栏或扫描,Docling 的投入就值。

Docling vs Marker

官方仓库

经验:CPU 本地的业务表格 → Docling。CPU 可跑/GPU 上的书籍与扫描文本 → Marker 2。

优势(Marker)

  • 多栏阅读顺序最强
  • Surya 2 OCR + LaTeX 公式
  • 书籍的干净 Markdown;fast 模式可跑 CPU

短板

  • 最高质量仍需 GPU(balanced 模式)
  • 中重型安装
  • Apache-2.0 代码但权重有上限(约$5M);无框表格偏弱

结论:200 PDF 独立测试中表格 Docling 领先(TEDS 约0.89对0.81),阅读顺序 Marker 领先,看场景定。

Docling vs MinerU

官方文档

经验:CPU 本地的业务表格 → Docling。GPU 上的论文、公式与 CJK → MinerU。

优势(MinerU)

  • 版式 SOTA(宣称 97.5 mAP)的 DocLayout-YOLO
  • UniMERNet 公式、跨页表格合并
  • 最强 CJK

短板

  • 需 GPU(4–8GB),单页流水线慢
  • 安装笨重;表格输出为 HTML
  • Apache 系许可附商业阈值与署名义务

结论:版式与公式 MinerU 领先,类型化文档、CPU 友好与许可简明 Docling 领先。按语料路由:论文走 MinerU,业务走 Docling。

Docling vs MarkItDown

官方文档

经验:受限环境中的简单 PDF + Office 混合 → MarkItDown。结构、表格或 OCR → Docling。

优势(MarkItDown)

  • MIT、约80MB、单文档一秒内
  • 格式覆盖极广(Office、HTML、音频、EPUB)
  • 可选 Azure 文档 OCR 后端

短板

  • pdfminer 内核:无版式模型、表格错乱
  • 分栏串行;默认无 OCR
  • OCR 需 LLM 插件或付费 Azure 页面

结论:把 MarkItDown 留作 Office/高速通道:它是转换器,不是文档理解的替代品。

Docling vs LlamaParse

Docling 文档

经验:LlamaIndex 技术栈、非涉密、中等体量 → LlamaParse。涉密、离线或海量 → 自托管 Docling。

优势(LlamaParse)

  • 分级模式(Fast 到 Agentic Plus)可锁定版本
  • 复杂版式精度强;免费额度慷慨
  • 零运维;LlamaIndex 原生集成

短板

  • 按页计费(约 $0.003–0.01),线性增长
  • 数据离境;闭源
  • SDK 迁移中;无公开基准透明度

结论:为省心付费,而非为独占付费:2026 年基准显示小型开放 VLM 在单卡上已持平。Mistral OCR、Reducto、Extend 与大厂 API(Azure、Textract、Google)同属托管路线:对比单页价、数据出境与锁定。

5
代码

同一任务,四种工具

每种工具做 PDF → Markdown。复制运行,感受搭建与输出的差别。

Docling(CLI)
docling convert report.pdf --to md --ocr-engine rapidocr

一条命令完成版式+表格+OCR 的本地流水线。

Unstructured(Python)
from unstructured.partition.pdf import partition_pdf
elements = partition_pdf('report.pdf', strategy='hi_res')

hi_res 需要版式模型,fast 策略弱得多。

PyMuPDF(Python)
import fitz
doc = fitz.open('report.pdf')
text = '\n'.join(p.get_text() for p in doc)

极快,但扫描页会静默输出空结果。

Marker(CLI)
marker_single report.pdf --output_dir out/

Marker 2 fast 模式可跑 CPU,最高质量在 GPU。

MinerU(CLI)
mineru -p report.pdf -o ./out

需 GPU;表格输出 HTML,公式输出 LaTeX。

MarkItDown(CLI)
markitdown report.pdf -o report.md

极快极小,但无版式模型、默认无 OCR。

6
方法

本页如何构建

依据:官方文档(Docling、Unstructured、PyMuPDF、Marker 仓库)加独立基准:200 PDF 对比(表格 TEDS、阅读顺序)与 500 PDF 企业研究(表格、分栏、OCR、速度)。要点:表格 Docling 领先(约97.9%/TEDS约0.89),阅读顺序与 GPU 速度 Marker 领先,原始速度 PyMuPDF 领先。

诚实规则:无付费排名,列出对手优势,版本(Docling v2.129.0、检查 2026-09-22)置顶。修正经 GitHub,以官方来源复核。

许可 2026 年复核:Marker 2 代码为 Apache-2.0(权重有上限),MinerU 使用附商业阈值的 Apache 系许可。

7
FAQ

常见问题

哪个最快?
数字 PDF 上 PyMuPDF 约0.01秒/页,比 ML 流水线快 10–50 倍。仅限干净文本层,扫描件需要 OCR。
表格哪个最准?
业务表格是 Docling(TableFormer,研究约97.9%);付费云 API 有时更高,以持续费用与数据出境为代价。
能完全离线吗?
能:Docling、PyMuPDF/pdfplumber、Marker 均可本地运行。Unstructured 的最佳能力在云 API。
SaaS 选哪个许可最安全?
Docling(MIT)最省心。PyMuPDF(AGPL)、Marker(GPL v3)需法务评估;Unstructured 是 Apache 2.0+商业混合。
扫描 PDF 怎么办?
Docling 可插拔 OCR(如 CPU 上的 RapidOCR),或 GPU 上的 Marker/Surya。单用 PyMuPDF 只会返回空字符串。
应该组合工具吗?
常见做法:高速页用 PyMuPDF、表格页用 Docling、疑难页用云。按页面质量路由胜过单一工具思维。
明天还有效吗?
版本变化很快(见页顶状态)。做架构决策前请查官方文档与发布说明。
MinerU 与 LlamaParse 摆在哪?
GPU 上的公式/CJK 论文用 MinerU;按页成本低于自运维时用 LlamaIndex 托管解析。两者在 CPU 友好与许可简明上不及 Docling。