El generador crea este fragmento por ti. Para PDF configura un objeto PdfPipelineOptions y lo registra mediante format_options; para cualquier otro formato basta con un DocumentConverter() simple.
- Cambia
export_to_markdown() por export_to_dict() para obtener JSON sin pérdidas. - Establece
pipeline_options.do_ocr = False para desactivar el OCR. - Usa
convert_all() para procesar varios archivos.
from docling.document_converter import DocumentConverter, PdfFormatOption
from docling.datamodel.base_models import InputFormat
from docling.datamodel.pipeline_options import PdfPipelineOptions
pipeline_options = PdfPipelineOptions()
pipeline_options.do_ocr = True
pipeline_options.do_table_structure = True
converter = DocumentConverter(
format_options={InputFormat.PDF: PdfFormatOption(pipeline_options=pipeline_options)}
)
result = converter.convert("report.pdf")
print(result.document.export_to_markdown())