- Base de conocimientos de IA
- herramientas de inteligencia artificial
- Inteligencia artificial
¿Qué es Docling? Una guía práctica para el análisis de documentos para RAG
Docling convierte archivos PDF, archivos de Office, imágenes, correos electrónicos y más en datos estructurados para IA. Descubra cómo funciona, dónde encaja en RAG y cómo se compara con otros analizadores de documentos.

Docling puede convertir un archivo desordenado en contenido estructurado y rastreable antes de que su IA lo vea. Esto es lo que eso significa en la práctica y cuándo otro analizador puede ser la mejor opción.
Cuando un asistente RAG da una respuesta incorrecta, el modelo de lenguaje es un blanco fácil. Pero muchos fracasos ocurren antes. Se leyó un PDF en el orden incorrecto. Una mesa se convirtió en un revoltijo de números. Se mezcló un pie de página con el cuerpo. Cuando la información llega al modelo, el significado ya se ha dañado.
Docling está diseñado para esa primera etapa que fácilmente pasa desapercibida. Convierte documentos en una representación estructurada que una aplicación puede exportar, inspeccionar, fragmentar, incrustar y recuperar. Es localmente primero, de código abierto y lo suficientemente flexible como para manejar todo, desde un archivo de Word limpio hasta un informe anual escaneado.
Esta guía explica Docling en inglés sencillo, muestra cómo encaja en una tubería RAG y lo compara con Unstructured, LlamaParse, Marker y PyMuPDF4LLM. El objetivo no es declarar un ganador universal. Es para ayudarle a elegir la capa de ingesta adecuada para los documentos que realmente tiene.
Actualización del 4 de septiembre de 2026
Docling v2.126.0 se publicó el 4 de septiembre de 2026. Su adición principal es una canalización de PDF nativa: una ruta más rápida que lee el texto y las imágenes del propio PDF sin ejecutar el diseño, OCR o los modelos de tabla. Esto ofrece a los equipos una opción útil: utilizar la extracción nativa para archivos PDF digitales sencillos y el canal de IA más completo cuando la estructura del documento es importante.
¿Qué es Docling?
Docling es un conjunto de herramientas de conversión de documentos de código abierto creado por investigadores de IBM y ahora alojado como un proyecto de LF AI & Data Foundation. Está disponible como biblioteca Python, herramienta de línea de comandos, servidor API autohospedado e integraciones para marcos de IA populares.
Su trabajo es tomar archivos diseñados para personas (PDF, documentos de Word, presentaciones, hojas de cálculo, imágenes, correos electrónicos, páginas web y más) y convertirlos en datos que el software pueda comprender. El funcionario Documentación Docling describe compatibilidad avanzada con PDF para diseño de páginas, orden de lectura, tablas, códigos, fórmulas, imágenes y OCR.
Docling es no una base de datos vectorial, un modelo de incrustación o una aplicación RAG completa. Prepara el material fuente para esos sistemas. Piense en ello como el puente entre "tenemos 20.000 archivos comerciales" y "nuestra IA puede buscar de manera confiable lo que hay dentro de ellos".
| Pregunta | respuesta corta |
|---|---|
| ¿Quién inició Docling? | El equipo de IA para el conocimiento de IBM Research |
| ¿Es de código abierto? | Sí. El código central tiene licencia MIT; verifique las licencias de los modelos opcionales que implemente. |
| ¿Se puede ejecutar localmente? | Sí, incluidos los entornos fuera de línea y con espacios aislados después de que se hayan precargado los artefactos del modelo. |
| ¿Qué produce? | Un estructurado DoclingDocument, con exportaciones como Markdown, HTML, texto, DocTags y JSON sin pérdidas. |
| ¿Para qué es mejor? | Ingestión de documentos, búsqueda de IA, RAG, flujos de trabajo de extracción y agentes que necesitan un contexto de documentos fundamentado. |
Por qué Docling es más que una herramienta de conversión de PDF a Markdown
La forma más sencilla de comprender Docling es comparar dos posibles salidas de la misma página.
Un extractor de texto básico podría devolver cada palabra visible como una cadena larga. Eso puede funcionar para una nota simple. Funciona mucho menos bien para un trabajo de investigación de dos columnas, un estado financiero con encabezados fusionados o un formulario donde la posición de un valor le indica lo que significa el valor.
Docling primero construye un DoclingDocument. Este modelo de documento unificado puede representar:
- texto, tablas, imágenes y elementos de valor clave;
- secciones, grupos y jerarquía de documentos;
- el orden de lectura previsto;
- encabezados y pies de página separados del cuerpo principal;
- ubicaciones de páginas y cuadros delimitadores cuando estén disponibles;
- procedencia que conecta un elemento extraído con su fuente.
Esa distinción importa. Markdown es una vista útil de un documento; no es el modelo del documento en sí. Una aplicación puede mantener la representación más rica para citas y validación y luego producir el resultado particular que necesita cada paso posterior.
Cómo funciona Docling, sin jerga
- Le das un archivo o URL. el
DocumentConverteridentifica el formato y selecciona un backend y un proceso de procesamiento adecuados. - Lee tanto el contenido como la estructura. Dependiendo del archivo y la configuración, Docling puede usar texto nativo, análisis de diseño, reconocimiento de tablas, OCR o un modelo de lenguaje visual.
- Construye un DoclingDocument. El texto se organiza junto con tablas, imágenes, jerarquía, geometría de página e información de origen.
- Tú eliges lo que sucede a continuación. Exporte a Markdown o HTML, serialice a JSON, cree fragmentos RAG, envíe el resultado a otro marco o exponga la conversión a través de un API.
Este diseño modular es una de las ideas más sólidas del Docling. Un PDF digital limpio no siempre necesita el mismo costoso procesamiento visual que un escaneo descolorido. Un trabajo de investigación puede necesitar fórmulas y un orden de lectura, mientras que un flujo de trabajo de facturas puede preocuparse más por las tablas y los pares clave-valor.
¿Qué formatos de archivo admite Docling?
la corriente referencia de formatos soportados cubre una combinación sorprendentemente amplia:
- Documentos: PDF, DOCX, archivos de Word heredados, texto OpenDocument, Markdown, AsciiDoc, LaTeX, HTML y EPUB;
- Hojas de cálculo y presentaciones: XLSX, PPTX, formatos antiguos de Microsoft Office, ODS, ODP, CSV y Apple Pages;
- Medios visuales: PNG, JPEG, TIFF, BMP y WebP;
- Comunicación y medios: EML, MSG, Box Notes, transcripciones de audio, video y WebVTT;
- Datos especializados: JATS, XBRL, USPTO XML, EBCDIC, DocLang y Docling JSON.
Algunos formatos requieren paquetes opcionales o herramientas del sistema. Los documentos heredados de Office necesitan LibreOffice, el audio y el vídeo necesitan el formato ASR adicional, el vídeo requiere FFmpeg y Apple Pages necesita el formato iWork adicional. En otras palabras, "compatible" no siempre significa "incluido en la instalación predeterminada más pequeña".
Cinco razones por las que Docling es atractivo para RAG
1. Mantiene más significado del documento.
RAG funciona mejor cuando los fragmentos contienen ideas coherentes. La jerarquía de páginas, los títulos, los encabezados de las tablas y el orden de lectura proporcionan un contexto que la división arbitraria de caracteres no puede recuperar. Los fragmentadores nativos de Docling operan en la estructura del documento en lugar de obligarlo a aplanar todo primero.
2. El procesamiento local es una opción de primera clase
Las canalizaciones principales de Docling pueden ejecutarse en su propia máquina o infraestructura. Esto es valioso para contratos, registros médicos, informes internos y otro material confidencial. el guía de opciones avanzadas dice que los servicios remotos requieren una suscripción explícita; de lo contrario, Docling impide esa operación.
Hay un matiz importante: el procesamiento local aún puede descargar los pesos del modelo la primera vez que utiliza la canalización de PDF. Para una implementación verdaderamente fuera de línea, obtenga previamente los artefactos necesarios, guárdelos internamente y apunte Docling a esa ruta.
3. Puedes elegir la velocidad o una comprensión más rica.
Docling no está bloqueado en un método de análisis. La canalización de PDF estándar combina etapas especializadas para diseño y tablas. Las canalizaciones de VLM pueden interpretar páginas de un extremo a otro. La nueva canalización de PDF nativo omite los modelos de IA cuando la extracción directa es suficiente. Eso hace posible enrutar documentos simples y difíciles de manera diferente en lugar de pagar el mismo costo informático por cada página.
4. Su fragmentación comprende la estructura del documento.
el HybridChunker comienza con elementos jerárquicos del documento, luego divide fragmentos de gran tamaño y fusiona los pequeños compatibles según un tokenizador. También puede repetir encabezados de tabla cuando una tabla abarca fragmentos. Esto se acerca mucho más a cómo un lector entiende un informe que "dividir cada 500 caracteres".
5. Encaja en una pila de IA existente
Docling enumera integraciones con LangChain, LlamaIndex, Haystack, CrewAI, bases de datos vectoriales y otras herramientas de IA. Los equipos pueden llamarlo directamente desde Python, ejecutar servicio-docling detrás de un punto final HTTP, utilice herramientas por lotes distribuidas o exponga la conversión de documentos a los agentes.
Cómo instalar y utilizar Docling
El paquete actual es compatible con Python 3.10 o posterior. La instalación más sencilla es:
pip install docling
Luego convierta un archivo local o URL y expórtelo a Markdown:
from docling.document_converter import DocumentConverter
converter = DocumentConverter()
document = converter.convert("annual-report.pdf").document
markdown = document.export_to_markdown()
print(markdown)
El flujo de trabajo de línea de comandos equivalente es igual de directo:
docling annual-report.pdf
Esto es suficiente para una primera prueba. Para producción, configure los formatos permitidos, los límites de tamaño de archivos y páginas, los idiomas OCR, los recursos informáticos, los tiempos de espera y el almacenamiento de modelos en lugar de depender de todos los valores predeterminados.
Usando Docling para RAG
Un error común es exportar Markdown e inmediatamente dividirlo por número de caracteres. Eso descarta parte de la estructura que Docling trabajó para recuperar. Para RAG, comience probando un fragmentador nativo:
from docling.chunking import HybridChunker
from docling.document_converter import DocumentConverter
document = DocumentConverter().convert("annual-report.pdf").document
chunker = HybridChunker()
texts_for_embedding = [
chunker.contextualize(chunk)
for chunk in chunker.chunk(dl_doc=document)
]
contextualize() agrega metadatos útiles, como encabezados o leyendas, al texto que incrusta. Docling recomienda hacer coincidir el tokenizador del fragmentador con el modelo de incrustación cuando los límites del token son importantes.
A partir de ahí, el flujo es familiar: incrustar el fragmento de texto, almacenar vectores y metadatos, recuperar fragmentos relevantes, opcionalmente reordenarlos y brindar la mejor evidencia a un modelo de generación. Para obtener una explicación arquitectónica más amplia, consulte nuestra guía para RAG y generación de recuperación aumentada y nuestra comparación de bases de datos vectoriales para RAG.
Una advertencia sobre Markdown y tablas complejas
Markdown es conveniente, legible y ampliamente compatible. No es sin pérdidas.
Docling documentación de serialización explica que las celdas de la tabla fusionada se conservan en JSON, DocLang, DocTags y HTML. Las tablas estándar Markdown no tienen sintaxis para intervalos de filas o columnas, por lo que esas relaciones se aplanan.
Si un flujo de trabajo financiero o científico depende de encabezados de varios niveles, no asuma que la exportación Markdown es la verdad básica. Conserve el DoclingDocument o el JSON sin pérdidas y utilice HTML o un serializador personalizado donde la estructura de la tabla debe sobrevivir.
¿Un mejor análisis realmente mejora RAG?
Un estudio de 2026 ofrece evidencia útil, no universal. Los investigadores compararon Docling, MinerU, Marker y DeepSeek OCR en 21 canales en 36 documentos administrativos portugueses. En ese corpus, Docling con división jerárquica y descripciones de imágenes logró el resultado de respuesta automatizada a preguntas más sólido, reportado como 94,1% ± 1,6%.
El resultado más importante fue más amplio: Enriquecimiento de metadatos y fragmentación consciente de la jerarquía. contribuyó más a la precisión que el convertidor por sí solo, y las preguntas dependientes de tablas produjeron las mayores lagunas. El estudio utilizó sólo 50 preguntas en un idioma y dominio, con un juez LLM, por lo que no debe leerse como una tabla de clasificación universal. Refuerza la lección de arquitectura: las opciones de análisis y fragmentación pueden cambiar materialmente las respuestas que recupera un sistema RAG.
Docling frente a Unstructured frente a LlamaParse frente a Marker
Estas herramientas se superponen, pero no son productos idénticos. La comparación más útil comienza con el modelo operativo y el flujo de trabajo: ni una sola puntuación de precisión.
| Herramienta | Modelo de entrega | Mejor ajuste | Principal compensación |
|---|---|---|---|
| Docling | Python de código abierto, CLI, API autohospedado | Ingestión local consciente de la estructura con un modelo de documento interno enriquecido | Usted es propietario de la implementación, el ajuste, los artefactos del modelo y el escalado. |
| Unstructured | Bibliotecas de código abierto más una plataforma ETL administrada | Amplios conectores de origen/destino y flujos de trabajo de ingesta de producción | Más superficie de plataforma; Las capacidades locales y gestionadas deben evaluarse por separado. |
| LlamaParse | LlamaCloud alojado API | Análisis gestionado de documentos difíciles con niveles de agente e instrucciones personalizadas. | Costo de uso, límite de datos en la nube y dependencia del servicio |
| Marker | Convertidor local de código abierto más opciones administradas de Datalab | Conversión rápida de PDF/documentos a Markdown, JSON, HTML o fragmentos | Los modos de calidad y hardware varían; revisión de las necesidades de licencia de peso del modelo |
| PyMuPDF4LLM | Biblioteca local ligera | Extracción rápida y de baja configuración en documentos que no necesitan un proceso de visión más pesado | Licencia AGPL/comercial y un modelo de documento de formato cruzado menos elaborado |
Docling frente a Unstructured
Unstructured también divide archivos en elementos semánticos y ofrece fragmentación consciente de la estructura. Su mayor diferenciador es el ecosistema ETL circundante: conectores, canalizaciones, enriquecimientos, incrustaciones y operaciones administradas para mover contenido desde los orígenes a los destinos.
Elija Docling cuando una capa de conversión de Python local, un modelo de documento explícito y un canal de análisis personalizable sean el centro del problema. Elija Unstructured cuando sincronizar continuamente muchos repositorios y destinos empresariales sea tan importante como analizar cada archivo. Ambos tienen componentes de código abierto, por lo que una verdadera competencia puede comenzar localmente.
Docling frente a LlamaParse
LlamaParse es parte de LlamaCloud, un servicio alojado de procesamiento de documentos. Su actual API ofrece niveles rápidos, rentables, agentic y agentic-plus, incluidas instrucciones en lenguaje natural para un análisis más complejo o específico de dominio.
La decisión es en gran medida operativa. LlamaParse es atractivo cuando desea un punto final administrado, capacidad elástica y análisis sofisticado sin ejecutar modelos usted mismo. Docling es atractivo cuando el control local, el uso aislado, la propiedad de infraestructura predecible y una tubería de código abierto inspeccionable son más importantes. Si los documentos no pueden salir de su entorno, esa distinción puede decidir la evaluación antes que la precisión.
Docling frente a Marker
Marker es otro potente conversor de documentos locales. Puede producir Markdown, JSON, HTML y fragmentos, y su canal actual utiliza selectivamente procesamiento de visión para escaneos, ecuaciones y estructuras de baja confianza. Es un candidato natural cuando los principales requisitos son la calidad de la conversión de PDF y la ejecución local.
Docling se destaca por el ecosistema DoclingDocument más amplio, su procedencia, su fragmentación nativa, sus canalizaciones configurables y su superficie de integración. El código de Marker es Apache 2.0, pero los pesos de su modelo actual tienen una licencia independiente basada en OpenRAIL con umbrales comerciales. El núcleo de Docling tiene licencia MIT, aunque aún se deben verificar las licencias de modelos opcionales. Ningún resumen de licencia reemplaza una revisión legal para una implementación comercial.
Docling frente a PyMuPDF4LLM
PyMuPDF4LLM es intencionalmente liviano. Utiliza el rápido motor MuPDF, no requiere GPU para su flujo de trabajo principal y puede emitir Markdown, JSON, texto y fragmentos de página. Para una colección de archivos PDF limpios, puede ofrecerle exactamente lo que necesita con menos maquinaria.
Docling tiene más sentido cuando desea una estructura multiformato más rica, modelos de tablas y diseños especializados, canalizaciones OCR/VLM conmutables o una representación común en muchos tipos de documentos. PyMuPDF4LLM tiene doble licencia AGPL y una licencia comercial, lo que también puede influir en las implementaciones propietarias.
Donde Docling puede tener problemas
Docling es capaz, pero no resuelve el problema del análisis de documentos.
- Las páginas complejas aún necesitan pruebas. Las tablas anidadas, las formas inusuales, la escritura a mano, los diagramas densos, los escaneos de baja calidad y las capas de texto rotas pueden confundir a cualquier analizador.
- La instalación predeterminada no es pequeña. Docling depende de Python y PyTorch, y las canalizaciones de PDF más ricas necesitan pesos de modelo. Se deben planificar descargas de primera ejecución y arranques en frío.
- El procesamiento de la CPU puede ser lento a escala. Local no significa automáticamente barato. Mida páginas por segundo, memoria, tiempo de cola y simultaneidad en su hardware real.
- Los formatos opcionales agregan dependencias. Los archivos heredados de Office, vídeo, audio y Apple Pages requieren componentes adicionales.
- La elección de salida puede eliminar la estructura. Una exportación Markdown conveniente puede aplanar la información que el modelo interno conservó.
- El proyecto avanza rápidamente. Los nuevos lanzamientos llegan con frecuencia. Fije versiones y realice pruebas de regresión en un conjunto de documentos representativos antes de actualizar.
- Es sólo la capa de ingestión. Aún necesita incrustaciones, almacenamiento, recuperación, control de acceso, evaluación y una estrategia de generación de respuestas.
Actualmente, la hoja de ruta oficial etiqueta la extracción automática de metadatos (como título, autores, referencias e idioma) como próximamente. Si esos campos son esenciales hoy, agregue su propio paso de extracción y validación en lugar de asumir que están completos.
¿Cuándo debería elegir Docling?
Docling merece una prueba seria cuando:
- los documentos deben permanecer dentro de su infraestructura;
- las tablas, el diseño de las páginas, la jerarquía o las citas son importantes para la recuperación;
- necesita un modelo de ingesta para archivos PDF, archivos de Office, contenido web, imágenes, correo electrónico o formatos especializados;
- su equipo se siente cómodo operando un servicio Python o una canalización por lotes;
- desea mantener una representación rica del documento en lugar de solo Markdown;
- necesita la libertad de cambiar entre procesamiento nativo, estándar, OCR y VLM.
Un servicio administrado puede ser la mejor opción cuando tiene un equipo de ingeniería pequeño, picos impredecibles o no desea operar la infraestructura de análisis. Una biblioteca más liviana puede ganar cuando casi todas las fuentes son archivos PDF limpios y digitales. El mejor analizador es el sistema menos complicado que conserva la información de la que depende su aplicación.
Cómo evaluar Docling en sus propios documentos
- Crea un conjunto de pruebas difícil. Incluya páginas de varias columnas, escaneos, páginas rotadas, tablas largas, celdas combinadas, gráficos, notas a pie de página y todos los idiomas importantes.
- Defina qué significa "correcto". Califique el orden de lectura, las celdas de la tabla, los encabezados, los pies de foto, las referencias de páginas y las omisiones, no solo la precisión de los caracteres.
- Comparar tuberías. Pruebe la extracción nativa, la canalización de PDF estándar, la configuración OCR y un VLM solo cuando la comprensión adicional pueda ayudar.
- Recuperación de pruebas de principio a fin. Haga preguntas cuyas respuestas dependan del diseño y las tablas. Verifique la evidencia recuperada antes de juzgar la prosa final.
- Operaciones de medida. Registre la latencia, el rendimiento, la memoria, el tamaño de descarga del modelo, las fallas y el costo de los reintentos o la revisión humana.
- Mantenga un corpus dorado. Vuelva a ejecutar los mismos documentos y preguntas después de cada cambio de analizador, modelo, fragmentador o versión.
No elija un analizador de un documento de demostración o de una tabla de clasificación de proveedores. Un archivo de adquisiciones, una biblioteca científica y un flujo de trabajo de facturación pueden producir tres ganadores diferentes.
Preguntas frecuentes
¿Docling es un producto de IBM?
Docling comenzó con el equipo de inteligencia artificial para el conocimiento de IBM Research. Ahora es un proyecto de código abierto alojado por LF AI & Data Foundation, con IBM todavía estrechamente asociado con su desarrollo e investigación.
¿Docling es gratuito y de código abierto?
Sí. El código principal de Docling está disponible bajo la licencia MIT. Los modelos opcionales y los componentes de terceros pueden tener sus propios términos, así que verifique los artefactos exactos utilizados en su implementación.
¿Docling se ejecuta localmente?
Sí. La ejecución local es una característica principal y los artefactos del modelo se pueden buscar previamente para entornos fuera de línea o aislados. El envío de contenido a un servicio de modelo remoto requiere una suscripción explícita.
¿Docling necesita una GPU?
No, no para uso básico. Docling admite la ejecución de CPU y su nueva canalización de PDF nativo no ejecuta modelos de diseño, OCR ni de tabla. Una GPU puede mejorar el rendimiento de canalizaciones basadas en IA más exigentes, especialmente en volumen.
¿Docling es bueno para RAG?
Sí, especialmente cuando la recuperación depende de la estructura del documento. Su modelo de documento unificado, su procedencia, sus fragmentadores conscientes de la jerarquía y sus integraciones de marco están diseñados para la ingestión de IA. Aún necesitas evaluarlo con tus archivos y construir el resto de la pila de recuperación.
¿Cuál es la diferencia entre Docling y OCR?
OCR reconoce texto en imágenes o escaneos. Docling puede usar OCR, pero también intenta comprender el orden de lectura, el diseño, las tablas, la jerarquía, las imágenes y las relaciones entre elementos. OCR es una etapa dentro de un flujo de trabajo más amplio de comprensión de documentos.
¿Es Docling mejor que LlamaParse o Unstructured?
No en todas las situaciones. Docling es particularmente atractivo para el control local y una rica representación estructurada. LlamaParse enfatiza un servicio de análisis agente administrado, mientras que Unstructured combina el análisis con una plataforma de conectores y ETL más amplia. Pruebe las herramientas con los mismos documentos, preguntas posteriores y limitaciones operativas.
Fuentes y metodología
Este artículo fue revisado en comparación con el documentación oficial Docling, repositorio de origen, Informe técnico de investigación de IBM, y Notas de la versión v2.126.0. Las comparaciones utilizan la documentación oficial o repositorios para Unstructured, LlamaParse, Marker, y PyMuPDF4LLM. Las capacidades y licencias de los productos pueden cambiar; Verifique la documentación actual antes de la implementación.
El resultado final
Docling es interesante porque trata la estructura del documento como datos que vale la pena conservar. Puede convertir muchos tipos de archivos en una representación común y rastreable, ejecutarse localmente y entregar material más limpio a las etapas de fragmentación y recuperación que siguen.
Sus puntos fuertes conllevan responsabilidad: usted opera la canalización, elige el modo de procesamiento correcto, preserva la salida correcta y prueba cada clase de documento difícil. Para los equipos que crean RAG privado o con mucha estructura, ese control suele ser el punto. Para los equipos que desean que el análisis desaparezca detrás de un API administrado, otra herramienta puede ser más adecuada.
La lección práctica es más simple que el panorama de herramientas: antes de cambiar su modelo de lenguaje, inspeccione lo que le proporcionó su analizador. Las mejores respuestas de IA suelen comenzar con un mejor documento.


