Le générateur construit cet extrait pour vous. Pour les PDF, il configure un objet PdfPipelineOptions et l'enregistre via format_options ; pour tout autre format, un simple DocumentConverter() suffit.
- Remplacez
export_to_markdown() par export_to_dict() pour un JSON sans perte. - Définissez
pipeline_options.do_ocr = False pour désactiver l'OCR. - Utilisez
convert_all() pour traiter plusieurs fichiers.
from docling.document_converter import DocumentConverter, PdfFormatOption
from docling.datamodel.base_models import InputFormat
from docling.datamodel.pipeline_options import PdfPipelineOptions
pipeline_options = PdfPipelineOptions()
pipeline_options.do_ocr = True
pipeline_options.do_table_structure = True
converter = DocumentConverter(
format_options={InputFormat.PDF: PdfFormatOption(pipeline_options=pipeline_options)}
)
result = converter.convert("report.pdf")
print(result.document.export_to_markdown())