Docling Konfigurator

Wählen Sie Ihre Optionen, um einen ausführbaren CLI-Befehl und ein entsprechendes Python-Snippet zu erzeugen. Die Flags folgen der aktuellen docling convert-Syntax – prüfen Sie die offizielle Dokumentation.

  1. 1ConfigureChoose your options
  2. 2Preview & copyCLI + Python snippet
  3. 3Run locallyPaste or download the script
Input

PDF unlocks the OCR and table options below; other formats use their own backend automatically.

OCR & tables
OCR-Engine aktivieren

Disabling OCR speeds up digital PDFs — keep it on for scans and photos.

Enrichment
Codeblöcke anreichern
LaTeX-Formeln anreichern
Diagrammdaten extrahieren

Each option adds a model pass — enable only what your document contains.

Output & performance

Auto selects CUDA → MPS → CPU; tune threads to your machine.

CLI-Befehl

bash

Python-Äquivalent

python
1
Schritt 1

So verwenden Sie den Konfigurator

Der Konfigurator erzeugt aus Ihren Auswahlen einen kopierfertigen docling convert-Befehl und ein entsprechendes Python-Snippet. Diese Anleitung erklärt jede Option, die Zuordnung der erzeugten Flags zur Python-API und die sichere Ausführung.

Arbeiten Sie von oben nach unten; die Vorschau aktualisiert sich bei jeder Änderung.

  1. Eingabeformat wählen das zu Ihrer Datei passt. Es ändert nur die Eingabebehandlung für PDFs; andere Formate nutzen ihr eigenes Backend.
  2. OCR entscheiden Für Scans und Fotos aktiviert lassen, für digitale PDFs deaktivieren - das beschleunigt die Konvertierung deutlich.
  3. OCR-Engine und -Modus wählen falls OCR aktiv ist. Beginnen Sie mit auto und wählen Sie eine konkrete Engine nur bei Bedarf.
  4. Tabellenmodus wählen accurate für komplexe Tabellen, fast, wenn Geschwindigkeit wichtiger ist als Präzision.
  5. Nur benötigte Anreicherung aktivieren Code, Formeln und Diagramme erfordern jeweils zusätzliche neuronale Verarbeitung.
  6. Ausgabeformat und Beschleuniger wählen Markdown zum Lesen, JSON für Struktur; GPU nur, wenn vorhanden.
  7. Kopieren oder Skript herunterladen Nutzen Sie CLI kopieren, Python kopieren oder Skript herunterladen (.sh).
  8. Ausführen und Ausgabe prüfen Die konvertierte Datei wird standardmäßig neben der Quelldatei gespeichert.
2
Schritt 2

Eingabeformat

Wählen Sie die passendste Option. Nur PDF- und Bildeingaben sind von den OCR- und Tabellenoptionen betroffen; alle anderen laufen automatisch über ihr formatspezifisches Backend.

EingabeEndungenOCR relevantHinweise
PDF.pdfJa (optional)Layout, Lesereihenfolge und Tabellen - der Hauptanwendungsfall für dieses Tool.
Word.docx, .docNeinÜberschriften, Listen und Tabellen bleiben erhalten.
PowerPoint.pptxNeinFolien, Textboxen und Notizen.
Excel.xlsxNeinJedes Blatt wird zu einer strukturierten Tabelle.
HTML.html, .htmNeinWebseiten und gespeichertes HTML.
Audio.mp3, .wavNeinNutzt die ASR-Pipeline; OCR-Optionen gelten nicht.
3
Schritt 3

OCR-Optionen

OCR wandelt Text auf Bildern in maschinenlesbaren Text um. Es ist der größte Einflussfaktor auf Genauigkeit und Laufzeit - aktivieren Sie es bewusst.

  • Aktivieren Sie OCR bei Scans, Fotos oder PDFs ohne wählbare Textebene.
  • Deaktivieren Sie OCR bei digitalen PDFs - das kann die Konvertierung um ein Vielfaches beschleunigen (--no-ocr).
  • Der Modus default behält vorhandenen Text und OCRt nur Seiten ohne Text.
  • Der Modus full_page OCRt jede Seite und überschreibt den erkannten Text.
EnginePlattformAm besten fürHinweise
autoAlleDocling entscheiden lassenStandard und sicherster Ausgangspunkt.
RapidOCRPlattformübergreifendCPU-freundliches mehrsprachiges OCRONNX-basiert; keine schweren Abhängigkeiten.
Tesseract (tesserocr)Plattformübergreifend (Systembinary)Ausgereiftes OCR mit vielen SprachenErfordert installiertes Tesseract und Sprachdaten.
EasyOCRPlattformübergreifendEinfache EinrichtungLädt bei der ersten Nutzung eigene Modelle.
OcrMacNur macOSNativer Apple-Vision-OCRNur unter macOS verfügbar.
Nemotron OCRLinux + CUDAGPU-beschleunigtes OCRErfordert eine unterstützte CUDA-Umgebung.
4
Schritt 4

Tabellenextraktion

Tabellen werden aus dem Layout rekonstruiert, nicht aus Rohtext - der gewählte Modus beeinflusst die Ergebnisqualität.

ModusModellGenauigkeitGeschwindigkeitVerwenden wenn
accurateTableFormerHochLangsamerVerbundene Zellen, rahmenlose Tabellen und Finanzberichte.
fastSchnelles StrukturmodellNäherungsweiseSchnellerSie nur eine grobe Tabelle brauchen und Tempo wichtig ist.
5
Schritt 5

Anreicherung

Anreicherung fügt neuronale Nachverarbeitung hinzu, um spezielle Inhalte zu erkennen. Aktivieren Sie sie nur, wenn das Dokument sie tatsächlich enthält.

OptionExtrahiertWann aktivierenKosten
--enrich-codeCodeblöckeTechnische und Entwicklerdokumente.Zusätzlicher Modelllauf
--enrich-formulaLaTeX-FormelnWissenschaftliche und akademische PDFs.Zusätzlicher Modelllauf
--enrich-chart-extractionDiagrammdatenBerichte mit Diagrammen.Zusätzlicher Modelllauf
6
Schritt 6

Ausgabeformat

Wählen Sie, was Sie mit dem Ergebnis tun möchten; die Vorschau aktualisiert auch den Export-Aufruf im Python-Snippet.

FormatErgebnisAm besten für
Markdown (md)Lesbarer Text mit TabellenNotizen, Dokumentation und RAG-Text.
Docling JSON (json)Verlustfreies DoclingDocument mit Bounding BoxesEigene Pipelines und Weiterverarbeitung.
HTML (html)Tabellen und Layout als HTMLWeb-Vorschauen und E-Mail.
DocTags (doctags)Kompaktes Token-MarkupModell-Eingabe und Token-Workflows.
7
Schritt 7

Beschleuniger und Threads

Docling läuft auf CPU, NVIDIA-GPUs (CUDA) und Apple Silicon (MPS). auto wählt CUDA, dann MPS, dann CPU.

  • Verwenden Sie --device cuda auf NVIDIA-Hardware für große Stapel.
  • Verwenden Sie --device mps auf Apple Silicon.
  • Deaktivieren Sie auf der CPU nicht benötigte OCR und Anreicherung.
EinstellungWerteWirkung
--deviceauto, cuda, mps, cpuLegt fest, wo die neuronale Inferenz läuft.
--num-threadsGanzzahl (Standard 4)CPU-Parallelität; zu viele Threads können kleine Rechner ausbremsen.
8
Schritt 8

Referenz der erzeugten Flags

Dies sind die Flags, die der Konfigurator erzeugen kann, mit der jeweiligen Python-Option. Die vollständige CLI finden Sie in der CLI-Referenz.

FlagWerteGilt fürPython-Äquivalent
--tomd, json, html, doctagsAlleexport_to_markdown(), export_to_dict(), export_to_html(), export_to_doctags()
--ocr-engineauto, rapidocr, tesserocr, easyocr, ocrmac, nemotron-ocrPDF & Bilderpipeline_options.ocr_options
--ocr-modedefault, full_pagePDF & Bilderpipeline_options.ocr_options
--no-ocrFlagPDFpipeline_options.do_ocr = False
--table-modeaccurate, fastPDFpipeline_options.do_table_structure
--enrich-codeFlagPDFpipeline_options.do_code_enrichment
--enrich-formulaFlagPDFpipeline_options.do_formula_enrichment
--enrich-chart-extractionFlagPDFpipeline_options.do_chart_extraction
--deviceauto, cuda, mps, cpuAlleAcceleratorOptions(device=...)
--num-threadsGanzzahlAlleAcceleratorOptions(num_threads=...)
9
Schritt 9

Das Python-Äquivalent

Der Konfigurator erstellt dieses Snippet für Sie. Für PDFs konfiguriert es ein PdfPipelineOptions-Objekt und registriert es über format_options; für jedes andere Format genügt ein einfaches DocumentConverter().

  • Ersetzen Sie export_to_markdown() durch export_to_dict() für verlustfreies JSON.
  • Setzen Sie pipeline_options.do_ocr = False, um OCR zu deaktivieren.
  • Nutzen Sie convert_all(), um mehrere Dateien zu verarbeiten.
from docling.document_converter import DocumentConverter, PdfFormatOption
from docling.datamodel.base_models import InputFormat
from docling.datamodel.pipeline_options import PdfPipelineOptions

pipeline_options = PdfPipelineOptions()
pipeline_options.do_ocr = True
pipeline_options.do_table_structure = True

converter = DocumentConverter(
    format_options={InputFormat.PDF: PdfFormatOption(pipeline_options=pipeline_options)}
)

result = converter.convert("report.pdf")
print(result.document.export_to_markdown())
10
Schritt 10

Rezepte

Kopieren Sie eine Vorlage und ändern Sie den Dateinamen.

Digitales PDF, schnellste Variante

Ohne OCR, Markdown-Ausgabe.

docling convert report.pdf --to md --no-ocr
Gescanntes PDF

Vollseiten-OCR, dann Markdown.

docling convert scan.pdf --to md --ocr-mode full_page
Wissenschaftliche Arbeit

Formeln und Code angereichert.

docling convert paper.pdf --to md --enrich-code --enrich-formula
Maschinenlesbare Struktur

Verlustfreies Docling JSON.

docling convert report.pdf --to json
Office-Dokumente

Word, PowerPoint und Excel.

docling convert workbook.xlsx --to md
GPU-Stapel

CUDA mit mehr Threads.

docling convert report.pdf --to md --device cuda --num-threads 8
11
Schritt 11

Warnungen des Konfigurators

Der Konfigurator prüft Kombinationen und warnt, wenn eine Auswahl keine Wirkung hat. Prüfen Sie ungewöhnliche Flags stets anhand der offiziellen CLI-Referenz.

  • Audio-Eingabe bei aktivem OCR (OCR gilt nicht für die ASR-Pipeline).
  • OcrMac auf einer Nicht-macOS-Plattform.
  • Nemotron OCR auf der CPU.
  • OCR deaktiviert, aber eine OCR-Engine ausgewählt.
12
Schritt 12

Leistung und Datenschutz

Der Konfigurator läuft vollständig in Ihrem Browser, und die erzeugten Befehle führen Docling lokal aus.

  • Deaktivieren Sie OCR bei digitalen PDFs; nur bei Scans aktiv lassen.
  • Nutzen Sie --table-mode fast, wenn ungefähre Tabellen akzeptabel sind.
  • Bevorzugen Sie bei großen Stapeln eine GPU und passen Sie --num-threads an.
  • Nichts wird hochgeladen: Ihre Auswahl verlässt den Browser nie.
13
Schritt 13

Weiter erkunden

Verwandte Werkzeuge und Referenzen.

14
Schritt 14

Häufig gestellte Fragen

Kann der erzeugte Befehl direkt ausgeführt werden?
Ja. Er verwendet die aktuelle docling convert-Syntax und nur die von Ihnen gewählten Optionen. Prüfen Sie ihn einmal und führen Sie ihn dann in Ihrer Umgebung aus.
Lädt der Konfigurator meine Dokumente oder Einstellungen hoch?
Nein. Alles wird lokal im Browser berechnet; nichts wird an einen Server gesendet. Die erzeugten Befehle verarbeiten Dokumente auf Ihrem Rechner.
Welche OCR-Engine sollte ich wählen?
Beginnen Sie mit auto. Auf reinen CPU-Systemen ist RapidOCR eine gute Wahl; unter macOS OcrMac und Nemotron OCR nur auf einer CUDA-GPU.
Warum unterscheidet sich der erzeugte Python-Code von der CLI?
Die CLI ordnet Flags intern Pipeline-Optionen zu. Das Python-Snippet macht diese Zuordnung explizit, damit Sie sie weiter anpassen können.
Benötige ich eine GPU?
Nein. Docling läuft auf der CPU. Eine GPU beschleunigt vor allem OCR und Anreicherung bei großen Dokumenten.
Funktioniert der Befehl unter Windows, macOS und Linux?
Ja. Derselbe Befehl läuft auf allen Plattformen; nur die Verfügbarkeit der OCR-Engines unterscheidet sich (OcrMac nur macOS, Nemotron OCR benötigt CUDA).
Wie erhalte ich Chunks für RAG statt Markdown?
Erzeugen Sie einen Markdown- oder JSON-Export und übergeben Sie das Ergebnis an HybridChunker. Siehe RAG-Anleitung.
Sind die Flags immer aktuell?
Sie folgen der docling convert-Schnittstelle zum Zeitpunkt der letzten Prüfung. Prüfen Sie ungewöhnliche Optionen anhand der offiziellen CLI-Referenz.