Docling 配置器

选择选项即可生成可执行的 CLI 命令和对应的 Python 代码。参数遵循当前的 docling convert 语法;请以官方文档为准。

  1. 1ConfigureChoose your options
  2. 2Preview & copyCLI + Python snippet
  3. 3Run locallyPaste or download the script
Input

PDF unlocks the OCR and table options below; other formats use their own backend automatically.

OCR & tables
启用 OCR 引擎

Disabling OCR speeds up digital PDFs — keep it on for scans and photos.

Enrichment
增强代码块
增强 LaTeX 公式
提取图表数据

Each option adds a model pass — enable only what your document contains.

Output & performance

Auto selects CUDA → MPS → CPU; tune threads to your machine.

CLI 命令

bash

对应的 Python 代码

python
1
?? 1

如何使用生成器

生成器会把你的选择转换为可直接复制的 docling convert 命令和等效的 Python 代码片段。本指南说明每个选项的作用、生成的参数如何对应 Python API,以及如何安全地运行结果。

从上到下依次设置;更改任意控件后预览都会更新。

  1. 选择输入格式 与文件匹配的格式。它只改变 PDF 的输入处理;其他格式会自动使用各自的后端。
  2. 决定是否使用 OCR 扫描件和照片保持开启,数字版 PDF 关闭可显著加快转换。
  3. 选择 OCR 引擎和模式 仅在启用 OCR 时。建议先用 auto,确有需要再选具体引擎。
  4. 选择表格模式 复杂表格用 accurate,更看重速度时用 fast
  5. 只启用需要的增强功能 代码、公式和图表各自都会增加神经处理。
  6. 选择输出格式和加速器 阅读用 Markdown,结构化用 JSON;只有确有 GPU 时再选。
  7. 复制或下载脚本 使用 复制 CLI复制 Python下载脚本 (.sh)
  8. 运行并检查输出 默认情况下转换后的文件会写在源文件旁边。
2
?? 2

输入格式

选择最接近的一项。只有 PDF 和图片输入受 OCR 与表格选项影响;其他格式会自动走各自的专用后端。

输入扩展名是否适用 OCR说明
PDF.pdf是(可选)版式、阅读顺序和表格,是本工具的主要用途。
Word.docx, .doc保留标题、列表和表格。
PowerPoint.pptx幻灯片、文本框和备注。
Excel.xlsx每个工作表都会转换为结构化表格。
HTML.html, .htm网页和保存的 HTML。
Audio.mp3, .wav使用 ASR 流水线;OCR 选项不适用。
3
?? 3

OCR 选项

OCR 会把图片上的文字转换为机器可读文本。它是影响精度和运行时间最大的因素,请按需谨慎启用。

  • 扫描件、照片或没有可选中文本层的 PDF 应启用 OCR。
  • 数字版 PDF 应关闭 OCR,转换速度可提升数倍(--no-ocr)。
  • default 模式保留已有文本,只对缺少文本的页面执行 OCR。
  • full_page 模式对每一页执行 OCR 并覆盖检测到的文本。
引擎平台最适合说明
auto全部让 Docling 自行选择默认值,最安全的起点。
RapidOCR跨平台适合 CPU 的多语言 OCR基于 ONNX,无繁重依赖。
Tesseract (tesserocr)跨平台(系统二进制)成熟且支持多种语言的 OCR需要先安装 Tesseract 和语言数据。
EasyOCR跨平台安装简单首次使用时自动下载模型。
OcrMac仅 macOS原生 Apple Vision OCR仅在 macOS 上可用。
Nemotron OCRLinux + CUDAGPU 加速 OCR需要受支持的 CUDA 环境。
4
?? 4

表格提取

表格是根据版式而非原始文本重建的,因此所选模式会影响结果质量。

模式模型精度速度适用场景
accurateTableFormer较慢合并单元格、无边框表格和财务报表。
fast快速结构模型近似较快只需要大致表格且更看重速度。
5
?? 5

增强功能

增强会添加神经后处理以识别专门内容。只有当文档确实包含这些内容时才启用。

选项提取内容何时启用成本
--enrich-code代码块技术和开发文档。额外的模型运行
--enrich-formulaLaTeX 公式科学和学术 PDF。额外的模型运行
--enrich-chart-extraction图表数据包含图表的报告。额外的模型运行
6
?? 6

输出格式

选择你想如何使用结果;预览也会同步更新 Python 代码片段中的导出调用。

格式你将得到最适合
Markdown (md)带表格的可读文本笔记、文档和 RAG 文本。
Docling JSON (json)带边界框的无损 DoclingDocument自定义流水线和后续处理。
HTML (html)HTML 格式的表格和版式网页预览和邮件。
DocTags (doctags)紧凑的 token 式标记模型输入和 token 工作流。
7
?? 7

加速器与线程

Docling 可在 CPU、NVIDIA GPU(CUDA)和 Apple Silicon(MPS)上运行。auto 会依次选择 CUDA、MPS、CPU。

  • 大批量处理时,在 NVIDIA 硬件上使用 --device cuda
  • 在 Apple Silicon 上使用 --device mps
  • 在 CPU 上关闭不需要的 OCR 和增强功能。
设置取值作用
--deviceauto, cuda, mps, cpu指定神经推理的运行设备。
--num-threads整数(默认 4)CPU 并行度;线程过多会拖慢小型机器。
8
?? 8

生成的参数参考

以下是生成器可输出的参数及其对应的 Python 选项。完整 CLI 请参阅 CLI 参考

参数取值适用范围Python 等效项
--tomd, json, html, doctags全部export_to_markdown(), export_to_dict(), export_to_html(), export_to_doctags()
--ocr-engineauto, rapidocr, tesserocr, easyocr, ocrmac, nemotron-ocrPDF 和图片pipeline_options.ocr_options
--ocr-modedefault, full_pagePDF 和图片pipeline_options.ocr_options
--no-ocr标志PDFpipeline_options.do_ocr = False
--table-modeaccurate, fastPDFpipeline_options.do_table_structure
--enrich-code标志PDFpipeline_options.do_code_enrichment
--enrich-formula标志PDFpipeline_options.do_formula_enrichment
--enrich-chart-extraction标志PDFpipeline_options.do_chart_extraction
--deviceauto, cuda, mps, cpu全部AcceleratorOptions(device=...)
--num-threads整数全部AcceleratorOptions(num_threads=...)
9
?? 9

Python 等效代码

生成器会为你构建此代码片段。对于 PDF,它会配置 PdfPipelineOptions 并通过 format_options 注册;其他格式只需简单的 DocumentConverter()

  • export_to_markdown() 换成 export_to_dict() 可获得无损 JSON。
  • 设置 pipeline_options.do_ocr = False 可关闭 OCR。
  • 使用 convert_all() 可批量处理多个文件。
from docling.document_converter import DocumentConverter, PdfFormatOption
from docling.datamodel.base_models import InputFormat
from docling.datamodel.pipeline_options import PdfPipelineOptions

pipeline_options = PdfPipelineOptions()
pipeline_options.do_ocr = True
pipeline_options.do_table_structure = True

converter = DocumentConverter(
    format_options={InputFormat.PDF: PdfFormatOption(pipeline_options=pipeline_options)}
)

result = converter.convert("report.pdf")
print(result.document.export_to_markdown())
10
?? 10

示例配方

复制预设并修改文件名即可。

数字版 PDF,最快

不使用 OCR,输出 Markdown。

docling convert report.pdf --to md --no-ocr
扫描版 PDF

全页 OCR 后输出 Markdown。

docling convert scan.pdf --to md --ocr-mode full_page
学术论文

增强公式和代码。

docling convert paper.pdf --to md --enrich-code --enrich-formula
机器可读结构

无损 Docling JSON。

docling convert report.pdf --to json
Office 文档

Word、PowerPoint 和 Excel。

docling convert workbook.xlsx --to md
GPU 批处理

使用更多线程的 CUDA。

docling convert report.pdf --to md --device cuda --num-threads 8
11
?? 11

生成器显示的警告

生成器会检查组合,并在某个选择不会生效时给出警告。对于不常见的参数,请务必对照官方 CLI 参考确认。

  • 选择音频输入但 OCR 仍开启(OCR 不适用于 ASR 流水线)。
  • 在非 macOS 平台选择了 OcrMac。
  • 在 CPU 上选择了 Nemotron OCR。
  • 已关闭 OCR 但仍选择了某个 OCR 引擎。
12
?? 12

性能与隐私

生成器完全在浏览器中运行,生成的命令会在本地执行 Docling。

  • 数字版 PDF 关闭 OCR,仅扫描件保留。
  • 可接受近似表格时使用 --table-mode fast
  • 大批量处理优先使用 GPU,并根据机器调整 --num-threads
  • 不会上传任何内容:你的选择不会离开浏览器。
13
?? 13

继续探索

相关工具与参考。

14
?? 14

常见问题

生成的命令可以直接运行吗?
可以。它使用当前的 docling convert 语法,且只包含你选择的选项。先检查一遍,再在你的环境中运行。
生成器会上传我的文档或设置吗?
不会。所有计算都在浏览器本地完成,不会向服务器发送任何内容。生成的命令会在你的机器上处理文档。
我应该选择哪个 OCR 引擎?
先用 auto。仅有 CPU 的机器上 RapidOCR 是不错的选择;macOS 上用 OcrMac,Nemotron OCR 只在 CUDA GPU 上使用。
生成的 Python 为什么和 CLI 不同?
CLI 会在内部把参数映射为流水线选项。Python 代码片段把这层映射显式化,方便你进一步调整。
我需要 GPU 吗?
不需要。Docling 可在 CPU 上运行。GPU 主要加快大文档的 OCR 和增强处理。
该命令能在 Windows、macOS 和 Linux 上使用吗?
可以。同一命令适用于所有平台,区别只在 OCR 引擎的可用性(OcrMac 仅 macOS,Nemotron OCR 需要 CUDA)。
如何获得用于 RAG 的分块而不是 Markdown?
导出 Markdown 或 JSON,再把结果传给 HybridChunker。请参阅 RAG 指南
这些参数总是最新的吗?
它们遵循最近一次检查时的 docling convert 接口。对于不常见的选项,请对照官方 CLI 参考确认。