from docling.document_converter import DocumentConverter
from docling.chunking import HybridChunker
converter = DocumentConverter()
result = converter.convert("report.pdf")
chunker = HybridChunker()
for chunk in chunker.chunk(result.document):
print(chunk.text)
Opciones usadas
--to chunks Emite salida fragmentada.
--chunks-type hybrid Usa HybridChunker.
Salida esperada
Chunks split on document structure rather than raw character counts.
Variantes
Inspeccionar la exportación sin procesar
docling convert report.pdf --to json
Error común: Usar un divisor de caracteres ingenuo en lugar de chunking consciente de la estructura, que rompe tablas y títulos.
Diez recetas listas para copiar para las tareas más comunes de Docling. Cada una incluye un comando CLI, el equivalente en Python, los flags que usa, la salida esperada y el error que debes evitar.
Recorre cada receta de arriba hacia abajo.
Encuentra tu tarea Filtra por categoría o busca un flag o palabra clave.
Copia el comando Usa el botón Copiar del bloque CLI o copia el equivalente en Python.
Ejecútalo Los comandos escriben el archivo convertido junto al original de forma predeterminada.
Revisa la salida Compárala con la salida esperada que muestra la receta.
Adáptalo Añade flags de la receta o crea un comando propio en el generador.
2
Paso 2
Antes de empezar
Todos los ejemplos suponen que Docling está instalado y que tienes un documento de muestra.
Se requiere Python 3.10 o posterior.
Los ejemplos de OCR necesitan un motor OCR; RapidOCR es una buena opción para CPU.
Los ejemplos de integración instalan un paquete aparte.
Usa la CLI para conversiones puntuales y la API de Python cuando necesites posprocesar el documento, procesar muchos archivos o integrarte con otra biblioteca.
CLI: rápido, scriptable y sin código.
Python: acceso total a DoclingDocument, chunks y opciones del pipeline.