- 1ConfigureChoose your options
- 2Preview & copyCLI + Python snippet
- 3Run locallyPaste or download the script
生成器会把你的选择转换为可直接复制的 docling convert 命令和等效的 Python 代码片段。本指南说明每个选项的作用、生成的参数如何对应 Python API,以及如何安全地运行结果。
从上到下依次设置;更改任意控件后预览都会更新。
auto,确有需要再选具体引擎。accurate,更看重速度时用 fast。选择最接近的一项。只有 PDF 和图片输入受 OCR 与表格选项影响;其他格式会自动走各自的专用后端。
| 输入 | 扩展名 | 是否适用 OCR | 说明 |
|---|---|---|---|
.pdf | 是(可选) | 版式、阅读顺序和表格,是本工具的主要用途。 | |
| Word | .docx, .doc | 否 | 保留标题、列表和表格。 |
| PowerPoint | .pptx | 否 | 幻灯片、文本框和备注。 |
| Excel | .xlsx | 否 | 每个工作表都会转换为结构化表格。 |
| HTML | .html, .htm | 否 | 网页和保存的 HTML。 |
| Audio | .mp3, .wav | 否 | 使用 ASR 流水线;OCR 选项不适用。 |
OCR 会把图片上的文字转换为机器可读文本。它是影响精度和运行时间最大的因素,请按需谨慎启用。
--no-ocr)。default 模式保留已有文本,只对缺少文本的页面执行 OCR。full_page 模式对每一页执行 OCR 并覆盖检测到的文本。| 引擎 | 平台 | 最适合 | 说明 |
|---|---|---|---|
auto | 全部 | 让 Docling 自行选择 | 默认值,最安全的起点。 |
| RapidOCR | 跨平台 | 适合 CPU 的多语言 OCR | 基于 ONNX,无繁重依赖。 |
| Tesseract (tesserocr) | 跨平台(系统二进制) | 成熟且支持多种语言的 OCR | 需要先安装 Tesseract 和语言数据。 |
| EasyOCR | 跨平台 | 安装简单 | 首次使用时自动下载模型。 |
| OcrMac | 仅 macOS | 原生 Apple Vision OCR | 仅在 macOS 上可用。 |
| Nemotron OCR | Linux + CUDA | GPU 加速 OCR | 需要受支持的 CUDA 环境。 |
表格是根据版式而非原始文本重建的,因此所选模式会影响结果质量。
| 模式 | 模型 | 精度 | 速度 | 适用场景 |
|---|---|---|---|---|
accurate | TableFormer | 高 | 较慢 | 合并单元格、无边框表格和财务报表。 |
fast | 快速结构模型 | 近似 | 较快 | 只需要大致表格且更看重速度。 |
增强会添加神经后处理以识别专门内容。只有当文档确实包含这些内容时才启用。
| 选项 | 提取内容 | 何时启用 | 成本 |
|---|---|---|---|
--enrich-code | 代码块 | 技术和开发文档。 | 额外的模型运行 |
--enrich-formula | LaTeX 公式 | 科学和学术 PDF。 | 额外的模型运行 |
--enrich-chart-extraction | 图表数据 | 包含图表的报告。 | 额外的模型运行 |
选择你想如何使用结果;预览也会同步更新 Python 代码片段中的导出调用。
| 格式 | 你将得到 | 最适合 |
|---|---|---|
Markdown (md) | 带表格的可读文本 | 笔记、文档和 RAG 文本。 |
Docling JSON (json) | 带边界框的无损 DoclingDocument | 自定义流水线和后续处理。 |
HTML (html) | HTML 格式的表格和版式 | 网页预览和邮件。 |
DocTags (doctags) | 紧凑的 token 式标记 | 模型输入和 token 工作流。 |
Docling 可在 CPU、NVIDIA GPU(CUDA)和 Apple Silicon(MPS)上运行。auto 会依次选择 CUDA、MPS、CPU。
--device cuda。--device mps。| 设置 | 取值 | 作用 |
|---|---|---|
--device | auto, cuda, mps, cpu | 指定神经推理的运行设备。 |
--num-threads | 整数(默认 4) | CPU 并行度;线程过多会拖慢小型机器。 |
以下是生成器可输出的参数及其对应的 Python 选项。完整 CLI 请参阅 CLI 参考。
| 参数 | 取值 | 适用范围 | Python 等效项 |
|---|---|---|---|
--to | md, json, html, doctags | 全部 | export_to_markdown(), export_to_dict(), export_to_html(), export_to_doctags() |
--ocr-engine | auto, rapidocr, tesserocr, easyocr, ocrmac, nemotron-ocr | PDF 和图片 | pipeline_options.ocr_options |
--ocr-mode | default, full_page | PDF 和图片 | pipeline_options.ocr_options |
--no-ocr | 标志 | pipeline_options.do_ocr = False | |
--table-mode | accurate, fast | pipeline_options.do_table_structure | |
--enrich-code | 标志 | pipeline_options.do_code_enrichment | |
--enrich-formula | 标志 | pipeline_options.do_formula_enrichment | |
--enrich-chart-extraction | 标志 | pipeline_options.do_chart_extraction | |
--device | auto, cuda, mps, cpu | 全部 | AcceleratorOptions(device=...) |
--num-threads | 整数 | 全部 | AcceleratorOptions(num_threads=...) |
生成器会为你构建此代码片段。对于 PDF,它会配置 PdfPipelineOptions 并通过 format_options 注册;其他格式只需简单的 DocumentConverter()。
export_to_markdown() 换成 export_to_dict() 可获得无损 JSON。pipeline_options.do_ocr = False 可关闭 OCR。convert_all() 可批量处理多个文件。from docling.document_converter import DocumentConverter, PdfFormatOption
from docling.datamodel.base_models import InputFormat
from docling.datamodel.pipeline_options import PdfPipelineOptions
pipeline_options = PdfPipelineOptions()
pipeline_options.do_ocr = True
pipeline_options.do_table_structure = True
converter = DocumentConverter(
format_options={InputFormat.PDF: PdfFormatOption(pipeline_options=pipeline_options)}
)
result = converter.convert("report.pdf")
print(result.document.export_to_markdown())
复制预设并修改文件名即可。
不使用 OCR,输出 Markdown。
docling convert report.pdf --to md --no-ocr全页 OCR 后输出 Markdown。
docling convert scan.pdf --to md --ocr-mode full_page增强公式和代码。
docling convert paper.pdf --to md --enrich-code --enrich-formula无损 Docling JSON。
docling convert report.pdf --to jsonWord、PowerPoint 和 Excel。
docling convert workbook.xlsx --to md使用更多线程的 CUDA。
docling convert report.pdf --to md --device cuda --num-threads 8生成器会检查组合,并在某个选择不会生效时给出警告。对于不常见的参数,请务必对照官方 CLI 参考确认。
生成器完全在浏览器中运行,生成的命令会在本地执行 Docling。
--table-mode fast。--num-threads。docling convert 语法,且只包含你选择的选项。先检查一遍,再在你的环境中运行。auto。仅有 CPU 的机器上 RapidOCR 是不错的选择;macOS 上用 OcrMac,Nemotron OCR 只在 CUDA GPU 上使用。HybridChunker。请参阅 RAG 指南。docling convert 接口。对于不常见的选项,请对照官方 CLI 参考确认。