PDF vers Markdown PDF et conversion
Du Markdown propre et lisible depuis n'importe quel PDF numérique.
Quand l'utiliser : Quand vous avez besoin d'un Markdown propre et lisible à partir d'un PDF numérique ou mixte.
CLI
docling convert report.pdf --to mdCopier
Python
from docling.document_converter import DocumentConverter
converter = DocumentConverter()
result = converter.convert("report.pdf")
print(result.document.export_to_markdown())
Options utilisées
--to md Sélectionne la sortie Markdown.
Sortie attendue
# Annual Report
## Revenue
| Year | Revenue |
|---|---:|
| 2025 | $12M |
| 2026 | $15M |
Variantes
Ignorer l'OCR pour la vitesse
docling convert report.pdf --to md --no-ocrCopier
Erreur fréquente : Traiter un PDF scanné et obtenir un texte vide. Si le PDF n'a pas de couche de texte, utilisez l'OCR (--ocr-mode full_page).
Documentation officielle · PDF vers JSON
PDF vers JSON PDF et conversion
La structure DoclingDocument complète pour vos pipelines.
Quand l'utiliser : Quand vous avez besoin de la structure sans perte DoclingDocument, y compris les bounding boxes et les métadonnées de mise en page.
CLI
docling convert report.pdf --to jsonCopier
Python
import json
from docling.document_converter import DocumentConverter
converter = DocumentConverter()
result = converter.convert("report.pdf")
print(json.dumps(result.document.export_to_dict(), indent=2))
Options utilisées
--to json Exporte la représentation JSON sans perte.
Sortie attendue
{
"schema_name": "DoclingDocument",
"texts": [ ... ],
"tables": [ ... ]
}
Variantes
Ignorer l'OCR pour la vitesse
docling convert report.pdf --to json --no-ocrCopier
Erreur fréquente : Attendre que le JSON de la CLI et export_to_dict() soient identiques octet pour octet ; ce sont des représentations équivalentes du même document.
Documentation officielle · PDF vers Markdown
URL vers Markdown PDF et conversion
Convertir un document directement depuis une URL HTTP.
Quand l'utiliser : Quand le document est en ligne et que vous ne voulez pas le télécharger d'abord.
CLI
docling convert https://arxiv.org/pdf/2408.09869 --to mdCopier
Python
from docling.document_converter import DocumentConverter
converter = DocumentConverter()
result = converter.convert("https://arxiv.org/pdf/2408.09869")
print(result.document.export_to_markdown())
Sortie attendue
## Docling Technical Report
...
Variantes
Exporter du JSON Ă la place
docling convert https://arxiv.org/pdf/2408.09869 --to jsonCopier
Erreur fréquente : Supposer que n'importe quelle URL fonctionne. La source doit être un format de document pris en charge et accessible en HTTP.
Documentation officielle · Formats pris en charge
PDF scanné avec OCR OCR et scans
Récupérer le texte de pages uniquement image.
Quand l'utiliser : Quand les pages sont des images et ne contiennent pas de texte sélectionnable.
CLI
docling convert scan.pdf --ocr-mode full_pageCopier
Python
from docling.document_converter import DocumentConverter, PdfFormatOption
from docling.datamodel.base_models import InputFormat
from docling.datamodel.pipeline_options import PdfPipelineOptions
pipeline_options = PdfPipelineOptions()
pipeline_options.do_ocr = True
converter = DocumentConverter(
format_options={InputFormat.PDF: PdfFormatOption(pipeline_options=pipeline_options)}
)
result = converter.convert("scan.pdf")
print(result.document.export_to_markdown())
Options utilisées
--ocr-mode full_page Applique l'OCR Ă toutes les pages, mĂŞme avec du texte.
Sortie attendue
Text reconstructed from the scanned page image.
Variantes
Choisir un autre moteur
docling convert scan.pdf --ocr-mode full_page --ocr-engine rapidocrCopier
Erreur fréquente : Laisser l'OCR activé sur des PDF numériques fait perdre du temps. Activez-le seulement si la couche de texte manque.
Documentation officielle · Comparer les moteurs OCR
Désactiver l'OCR pour les PDF numériques OCR et scans
Conversion bien plus rapide pour les PDF numériques.
Quand l'utiliser : Quand le PDF possède déjà une couche de texte et que vous voulez la conversion la plus rapide.
CLI
docling convert report.pdf --no-ocr --to mdCopier
Python
from docling.document_converter import DocumentConverter, PdfFormatOption
from docling.datamodel.base_models import InputFormat
from docling.datamodel.pipeline_options import PdfPipelineOptions
pipeline_options = PdfPipelineOptions()
pipeline_options.do_ocr = False
converter = DocumentConverter(
format_options={InputFormat.PDF: PdfFormatOption(pipeline_options=pipeline_options)}
)
result = converter.convert("report.pdf")
print(result.document.export_to_markdown())
Options utilisées
--no-ocr Ignore complètement l'étape OCR.
Sortie attendue
Markdown produced without running OCR.
Variantes
Tableaux rapides aussi
docling convert report.pdf --no-ocr --table-mode fastCopier
Erreur fréquente : Désactiver l'OCR sur un PDF scanné donne peu ou pas de texte.
Documentation officielle · Toutes les commandes
Chunking RAG avec HybridChunker RAG
Des chunks structurés prêts pour une base vectorielle.
Quand l'utiliser : Quand vous voulez des chunks qui préservent titres, tableaux et métadonnées de page pour une base vectorielle.
CLI
docling convert report.pdf --to chunks --chunks-type hybridCopier
Python
from docling.document_converter import DocumentConverter
from docling.chunking import HybridChunker
converter = DocumentConverter()
result = converter.convert("report.pdf")
chunker = HybridChunker()
for chunk in chunker.chunk(result.document):
print(chunk.text)
Options utilisées
--to chunks Produit une sortie découpée.--chunks-type hybrid Utilise HybridChunker.
Sortie attendue
Chunks split on document structure rather than raw character counts.
Variantes
Inspecter l'export brut
docling convert report.pdf --to jsonCopier
Erreur fréquente : Utiliser un découpage naïf par caractères au lieu d'un chunking conscient de la structure, qui casse tableaux et titres.
Documentation officielle · Guide RAG
Intégration LangChain Intégrations
Charger des documents analysés dans un pipeline LangChain.
Quand l'utiliser : Quand vous chargez des documents analysés dans un pipeline LangChain.
CLI
pip install langchain-doclingCopier
Python
from langchain_docling import DoclingLoader
loader = DoclingLoader(file_path="report.pdf")
docs = loader.load()
print(docs[0].page_content[:200])
Sortie attendue
LangChain Document objects with parsed page content and metadata.
Variantes
Puis convertir un fichier
docling convert report.pdf --to mdCopier
Erreur fréquente : Oublier d'installer le paquet d'intégration séparément de docling.
Documentation officielle · Recette LlamaIndex
Intégration LlamaIndex Intégrations
Créer des nœuds LlamaIndex à partir de fichiers analysés.
Quand l'utiliser : Quand vous construisez des nœuds de document LlamaIndex à partir de fichiers analysés.
CLI
pip install llama-index-readers-doclingCopier
Python
from llama_index.readers.docling import DoclingReader
reader = DoclingReader()
documents = reader.load_data(file_path="report.pdf")
print(documents[0].text[:200])
Sortie attendue
LlamaIndex documents ready for indexing.
Variantes
Puis convertir un fichier
docling convert report.pdf --to mdCopier
Erreur fréquente : Mélanger les versions de docling et du paquet reader ; gardez les deux à jour.
Documentation officielle · Recette LangChain
Aucun exemple ne correspond Ă votre filtre.