Der Konfigurator erstellt dieses Snippet für Sie. Für PDFs konfiguriert es ein PdfPipelineOptions-Objekt und registriert es über format_options; für jedes andere Format genügt ein einfaches DocumentConverter().
- Ersetzen Sie
export_to_markdown() durch export_to_dict() für verlustfreies JSON. - Setzen Sie
pipeline_options.do_ocr = False, um OCR zu deaktivieren. - Nutzen Sie
convert_all(), um mehrere Dateien zu verarbeiten.
from docling.document_converter import DocumentConverter, PdfFormatOption
from docling.datamodel.base_models import InputFormat
from docling.datamodel.pipeline_options import PdfPipelineOptions
pipeline_options = PdfPipelineOptions()
pipeline_options.do_ocr = True
pipeline_options.do_table_structure = True
converter = DocumentConverter(
format_options={InputFormat.PDF: PdfFormatOption(pipeline_options=pipeline_options)}
)
result = converter.convert("report.pdf")
print(result.document.export_to_markdown())