IBM Research & LF AI & Data Projekt

Docling: Ultraschnelle Dokumentenverarbeitung für KI

Docling wandelt PDFs, Office-Dateien, Bilder und Audio in strukturiertes Markdown und JSON um. Entwickelt für Generative KI, RAG und Agenten-Pipelines.

bash — quickstart
$pip install docling
$docling https://arxiv.org/pdf/2408.09869 --to md

Was ist Docling?

Docling ist eine quelloffene Engine zur Dokumentenkonvertierung und Layoutanalyse von IBM Research unter der LF AI & Data Foundation. Sie konvertiert PDFs, Word (DOCX), PowerPoint (PPTX), Excel (XLSX), HTML, gescannte Bilder und Audio in strukturiertes Markdown und JSON mit Granite Docling und TableFormer.

Entwickelt für moderne KI & Datenverarbeitung

Alles, was Sie benötigen, um Rohdokumente in strukturierte Daten für LLMs zu verwandeln.

Multimodales Dokumenten-Parsing

Verarbeitet PDF, DOCX, PPTX, XLSX, HTML, EPUB, LaTeX, CSV, Audio (WAV, MP3) und Patent-XML (USPTO, JATS) mit einer einheitlichen API.

PDFDOCXPPTXXLSXAudio (ASR)

Layout & Lesereihenfolge

Erkennt mehrspaltige Layouts, Kopf-/Fußzeilen und visuelle Hierarchien präzise.

MehrspaltigBounding Boxes

TableFormer Tabellenmodell

Neuronales Modell zur präzisen Rekonstruktion komplexer verbundener Zellen und rahmenloser Tabellen.

TableFormer v2HTML Tabellen

Pluggable OCR-Engines

Wählen Sie zwischen EasyOCR, Tesseract, RapidOCR, OcrMac und Nemotron OCR für gescannte Dokumente.

RapidOCRTesseractEasyOCR

RAG `HybridChunker`

Teilt Dokumente nach strukturellen Knoten unter Erhalt von Überschriften, Tabellen und Bounding-Boxes.

HybridChunkerVektordatenbanken

DoclingDocument & KI-Ökosystem

Exportiert nach Markdown, JSON oder DocTags mit nativer Integration für LangChain, LlamaIndex, Haystack, CrewAI und MCP.

LangChainLlamaIndexMCP Serverdocling-serve

Docling für Ihre Plattform installieren

Docling läuft lokal auf Windows (64-Bit), macOS (Apple Silicon & Intel) und Linux.

Installation via pip
$pip install docling
# Extras: pip install "docling[rapidocr,tesserocr,vlm,asr]"
Installation via Astral uv
$uv add docling
Windows 10 / 11 PowerShell (Python 64-Bit)
# Option A (Empfohlen): Vorkompilierte Binärdateien via uv
PS>uv add docling
# Option B: Standard pip (Visual C++ 14.0+ für C-Erweiterungen erforderlich)
PS>pip install docling
Container-Ausführung
$docker run -it --rm -v $(pwd):/docs quay.io/ds4sd/docling:latest docling /docs/sample.pdf
MCP-Server für Claude Desktop & LM Studio
uvx --from=docling-mcp docling-mcp-server
macOS Intel x86_64
$pip install "docling[mac_intel]"
Linux PyTorch CPU
$pip install docling --extra-index-url https://download.pytorch.org/whl/cpu

Docling im Vergleich zu Alternativen

Wie sich Docling gegenüber anderen Tools im KI-Bereich positioniert.

Im Vergleich zu reinen Textextraktoren wie PyPDF oder pdfplumber führt Docling eine vollständige Layoutanalyse durch und rekonstruiert Tabellen mit TableFormer. Gegenüber Unstructured.io läuft Docling 100% lokal ohne Zwang zu Cloud-APIs.

Funktion / Metrik Docling (v2.115) Unstructured.io PyPDF / pdfplumber Marker
Komplexe PDF-Layoutanalyse
Tabellen-Erkennung (TableFormer) Teilweise / Kostenpflichtig Einfaches Gitter
Audio / Video Transkription (ASR) (Whisper)
MCP Server Integration (Nativ)
100% Kostenlos Open Source (MIT) Apache 2.0 / Kommerziell BSD / MIT GPL v3 / Kommerziell

Befehls-Cheatsheet

Wichtige CLI-Befehle zum direkten Kopieren.

PDF in Markdown konvertieren

Konvertiert eine lokale PDF-Datei direkt in Markdown.

docling report.pdf --to md
Dokument von URL laden

Lädt ein Online-Dokument herunter und verarbeitet es direkt.

docling https://arxiv.org/pdf/2408.09869
Vollseiten-OCR erzwingen

Führt OCR über die gesamten Seiten aus.

docling scan.pdf --ocr-mode full_page
Verlustfreies JSON exportieren

Gibt detailliertes JSON mit Bounding-Box-Koordinaten aus.

docling document.pdf --to json
Formeln & Code anreichern

Extrahiert LaTeX-Formeln und Codeblöcke mit neuronalen Modellen.

docling paper.pdf --enrich-code --enrich-formula
Audio & Video transkribieren

Konvertiert Audio-Dateien (MP3, WAV) in strukturierten Text.

docling lecture.mp3 --pipeline asr --to md
Alle Modelle herunterladen

Lädt alle Modelle für die Offline-Nutzung vorab herunter.

docling-tools models download --all
Docling MCP-Server starten

Startet den MCP-Server für die Claude Desktop Integration.

uvx --from=docling-mcp docling-mcp-server

CLI & Python Konfigurationsgenerator

Passen Sie Optionen an und generieren Sie Befehle und Code in Echtzeit.

OCR-Engine aktivieren
Code-Blöcke anreichern
LaTeX-Formeln anreichern

CLI-Befehl Ausgabe

docling bash

              

Python SDK Äquivalent

docling python

              

Häufig gestellte Fragen (FAQ)

Antworten zu Installation, OCR-Optionen, Offline-Nutzung und Performance.

Was ist Docling und wofür wird es eingesetzt?
Docling ist eine quelloffene Dokumenten-Engine von IBM Research, die PDFs, Office-Dateien (DOCX, PPTX, XLSX), gescannte Bilder und Audio in strukturiertes Markdown und JSON für KI-Modelle und RAG umwandelt.
Ist Docling komplett kostenlos und Open Source?
Ja, Docling ist 100% kostenlos und unter der MIT-Lizenz veröffentlicht. Es kann ohne Cloud-Kosten oder Telemetrie lokal betrieben werden.
Werden Dokumentendaten an externe Cloud-Server gesendet?
Nein. Docling arbeitet zu 100% lokal und on-premise auf Ihrer eigenen Hardware oder in privaten Containern. Es werden keine Dokumentendaten oder Telemetriedaten übertragen.
Benötigt Docling Microsoft Visual C++ Build Tools unter Windows?
Unter Windows ist 64-Bit-Python erforderlich. Für pip-Installationen mit kompilierten C++-Erweiterungen sind Visual C++ 14.0+ Build Tools nötig. Über Astral uv (uv add docling) werden vorkompilierte Wheels genutzt, sodass kein C++-Compiler benötigt wird.
Wie deaktiviere ich OCR für schnellere PDF-Konvertierung?
Bei digitalen PDFs kann OCR mit pipeline_options.do_ocr = False in Python oder --no-ocr im CLI deaktiviert werden, was die Geschwindigkeit um das 5- bis 10-fache steigert.
Kann Docling Excel (.xlsx) und PowerPoint (.pptx) verarbeiten?
Ja, Docling parst Excel-Arbeitsmappen (.xlsx) tabellenblattweise in strukturierte Markdown/HTML-Tabellen und extrahiert aus PowerPoint-Präsentationen (.pptx) Folienhierarchien und Notizen.