- Base de conhecimento de IA
- Ferramentas de IA
- Inteligência artificial
O que é Docling? Um guia prático para análise de documentos para RAG
Docling transforma PDFs, arquivos do Office, imagens, e-mail e muito mais em dados estruturados para IA. Aprenda como funciona, onde se encaixa no RAG e como se compara a outros analisadores de documentos.

Docling pode transformar um arquivo confuso em conteúdo estruturado e rastreável antes que sua IA o veja. Aqui está o que isso significa na prática – e quando outro analisador pode ser a melhor escolha.
Quando um assistente RAG dá a resposta errada, o modelo de linguagem é um alvo fácil. Mas muitas falhas acontecem mais cedo. Um PDF foi lido na ordem errada. Uma mesa tornou-se uma confusão de números. Um rodapé foi misturado ao corpo. No momento em que a informação chega ao modelo, o significado já foi prejudicado.
O Docling foi desenvolvido para esse primeiro estágio facilmente esquecido. Ele converte documentos em uma representação estruturada que um aplicativo pode exportar, inspecionar, agrupar, incorporar e recuperar. É local, de código aberto e flexível o suficiente para lidar com tudo, desde um arquivo Word limpo até um relatório anual digitalizado.
Este guia explica Docling em inglês simples, mostra como ele se encaixa em um pipeline RAG e o compara com Unstructured, LlamaParse, Marker e PyMuPDF4LLM. O objetivo não é declarar um vencedor universal. É para ajudá-lo a escolher a camada de ingestão correta para os documentos que você realmente possui.
Atualização de 4 de setembro de 2026
Docling v2.126.0 foi lançado em 4 de setembro de 2026. Sua adição de título é um pipeline de PDF nativo: um caminho mais rápido que lê o próprio texto e imagens de um PDF sem executar o layout, OCR ou modelos de tabela. Isso dá às equipes uma escolha útil: usar a extração nativa para PDFs digitais simples e o pipeline de IA mais completo quando a estrutura do documento é importante.
O que é Docling?
Docling é um kit de ferramentas de conversão de documentos de código aberto criado por pesquisadores da IBM e agora hospedado como um projeto da LF AI & Data Foundation. Ele está disponível como uma biblioteca Python, ferramenta de linha de comando, servidor API auto-hospedado e integrações para estruturas de IA populares.
Seu trabalho é pegar arquivos que foram projetados para pessoas – PDFs, documentos do Word, apresentações, planilhas, imagens, e-mails, páginas da web e muito mais – e transformá-los em dados que o software possa entender. O oficial Documentação Docling descreve suporte avançado a PDF para layout de página, ordem de leitura, tabelas, código, fórmulas, imagens e OCR.
Docling é não um banco de dados vetorial, um modelo de incorporação ou um aplicativo RAG completo. Ele prepara o material de origem para esses sistemas. Pense nisso como a ponte entre “temos 20.000 arquivos de negócios” e “nossa IA pode pesquisar com segurança o que está dentro deles”.
| Pergunta | Resposta curta |
|---|---|
| Quem iniciou o Docling? | Equipe de IA para conhecimento da IBM Research |
| É código aberto? | Sim. O código principal é licenciado pelo MIT; verifique as licenças dos modelos opcionais que você implanta. |
| Ele pode ser executado localmente? | Sim, incluindo ambientes off-line e isolados após a pré-busca dos artefatos do modelo. |
| O que isso produz? | Um estruturado DoclingDocument, com exportações como Markdown, HTML, texto, DocTags e JSON sem perdas. |
| Para que é melhor? | Ingestão de documentos, pesquisa de IA, RAG, fluxos de trabalho de extração e agentes que precisam de contexto documental fundamentado. |
Por que Docling é mais do que uma ferramenta de PDF para Markdown
A maneira mais fácil de entender Docling é comparar duas saídas possíveis da mesma página.
Um extrator de texto básico pode retornar cada palavra visível como uma longa string. Isso pode funcionar para um memorando simples. Funciona muito menos bem para um artigo de pesquisa de duas colunas, um demonstrativo financeiro com cabeçalhos mesclados ou um formulário onde a posição de um valor informa o que o valor significa.
Docling primeiro constrói um DoclingDocument. Este modelo de documento unificado pode representar:
- texto, tabelas, imagens e itens de valores-chave;
- seções, grupos e hierarquia de documentos;
- a ordem de leitura pretendida;
- cabeçalhos e rodapés separados do corpo principal;
- localizações de páginas e caixas delimitadoras, quando disponíveis;
- proveniência que conecta um elemento extraído à sua fonte.
Essa distinção é importante. Markdown é uma visualização útil de um documento; não é o modelo do documento em si. Um aplicativo pode manter a representação mais rica para citações e validação e, em seguida, produzir a saída específica que cada etapa posterior precisa.
Como funciona o Docling, sem jargões
- Você fornece um arquivo ou URL. O
DocumentConverteridentifica o formato e seleciona um back-end e pipeline de processamento apropriados. - Ele lê conteúdo e estrutura. Dependendo do arquivo e da configuração, Docling pode usar texto nativo, análise de layout, reconhecimento de tabela, OCR ou um modelo de linguagem de visão.
- Ele constrói um DoclingDocument. O texto é organizado junto com tabelas, imagens, hierarquia, geometria da página e informações de origem.
- Você escolhe o que acontece a seguir. Exporte para Markdown ou HTML, serialize para JSON, crie pedaços RAG, envie o resultado para outra estrutura ou exponha a conversão por meio de um API.
Este design modular é uma das ideias mais fortes do Docling. Um PDF digital limpo nem sempre precisa do mesmo processamento visual caro que uma digitalização desbotada. Um artigo de pesquisa pode precisar de fórmulas e ordem de leitura, enquanto um fluxo de trabalho de fatura pode se preocupar mais com tabelas e pares de valores-chave.
Quais formatos de arquivo o Docling suporta?
O atual referência de formatos suportados cobre uma mistura surpreendentemente ampla:
- Documentos: PDF, DOCX, arquivos Word legados, texto OpenDocument, Markdown, AsciiDoc, LaTeX, HTML e EPUB;
- Planilhas e apresentações: XLSX, PPTX, formatos mais antigos do Microsoft Office, ODS, ODP, CSV e Apple Pages;
- Mídia visual: PNG, JPEG, TIFF, BMP e WebP;
- Comunicação e mídia: EML, MSG, Box Notes, áudio, transcrições de vídeo e WebVTT;
- Dados especializados: JATS, XBRL, USPTO XML, EBCDIC, DocLang e Docling JSON.
Alguns formatos requerem pacotes opcionais ou ferramentas de sistema. Documentos legados do Office precisam do LibreOffice, áudio e vídeo precisam do ASR extra, o vídeo requer FFmpeg e o Apple Pages precisa do formato iWork extra. Em outras palavras, “suportado” nem sempre significa “incluído na menor instalação padrão”.
Cinco razões pelas quais Docling é atraente para RAG
1. Mantém mais o significado do documento
RAG funciona melhor quando os pedaços carregam ideias coerentes. Hierarquia de páginas, legendas, cabeçalhos de tabelas e ordem de leitura fornecem contexto que a divisão arbitrária de caracteres não pode recuperar. Os chunkers nativos do Docling operam na estrutura do documento em vez de forçar você a nivelar tudo primeiro.
2. O processamento local é uma opção de primeira classe
Os principais pipelines do Docling podem ser executados em sua própria máquina ou infraestrutura. Isso é valioso para contratos, registros de saúde, relatórios internos e outros materiais confidenciais. O guia de opções avançadas diz que os serviços remotos exigem uma aceitação explícita; caso contrário, Docling impedirá essa operação.
Há uma nuance importante: o processamento local ainda pode baixar pesos de modelo na primeira vez que você usar o pipeline de PDF. Para uma implantação verdadeiramente offline, busque previamente os artefatos necessários, armazene-os internamente e aponte Docling para esse caminho.
3. Você pode escolher velocidade ou compreensão mais rica
Docling não está bloqueado para um método de análise. O pipeline de PDF padrão combina estágios especializados para layout e tabelas. Os pipelines VLM podem interpretar páginas de ponta a ponta. O novo pipeline de PDF nativo ignora os modelos de IA quando a extração direta é suficiente. Isso torna possível encaminhar documentos simples e difíceis de maneira diferente, em vez de pagar o mesmo custo computacional para cada página.
4. Seu chunking entende a estrutura do documento
O HybridChunker começa com elementos hierárquicos do documento, depois divide pedaços grandes e mescla pequenos pedaços compatíveis de acordo com um tokenizer. Ele também pode repetir cabeçalhos de tabela quando uma tabela abrange partes. Isso está muito mais próximo de como um leitor entende um relatório do que “dividir a cada 500 caracteres”.
5. Ele se encaixa em uma pilha de IA existente
Docling lista integrações com LangChain, LlamaIndex, Haystack, CrewAI, bancos de dados vetoriais e outras ferramentas de IA. As equipes podem chamá-lo diretamente do Python, executar docagem-servir atrás de um endpoint HTTP, use ferramentas em lote distribuídas ou exponha a conversão de documentos a agentes.
Como instalar e usar Docling
O pacote atual suporta Python 3.10 ou mais recente. A instalação mais simples é:
pip install docling
Em seguida, converta um arquivo local ou URL e exporte-o para Markdown:
from docling.document_converter import DocumentConverter
converter = DocumentConverter()
document = converter.convert("annual-report.pdf").document
markdown = document.export_to_markdown()
print(markdown)
O fluxo de trabalho de linha de comando equivalente é igualmente direto:
docling annual-report.pdf
Isso é suficiente para um primeiro teste. Para produção, configure formatos permitidos, limites de tamanho de página e arquivo, idiomas OCR, recursos de computação, tempos limite e armazenamento de modelo em vez de confiar em todos os padrões.
Usando Docling para RAG
Um erro comum é exportar Markdown e dividi-lo imediatamente pela contagem de caracteres. Isso descarta parte da estrutura que Docling trabalhou para recuperar. Para RAG, comece testando um chunker nativo:
from docling.chunking import HybridChunker
from docling.document_converter import DocumentConverter
document = DocumentConverter().convert("annual-report.pdf").document
chunker = HybridChunker()
texts_for_embedding = [
chunker.contextualize(chunk)
for chunk in chunker.chunk(dl_doc=document)
]
contextualize() adiciona metadados úteis, como títulos ou legendas, ao texto incorporado. Docling recomenda combinar o tokenizer do chunker com o modelo de incorporação quando os limites do token são importantes.
A partir daí, o fluxo é familiar: incorporar o texto do pedaço, armazenar vetores e metadados, recuperar pedaços relevantes, reclassificá-los opcionalmente e fornecer a melhor evidência para um modelo de geração. Para uma explicação arquitetônica mais ampla, consulte nosso guia para RAG e geração aumentada de recuperação e nossa comparação de bancos de dados vetoriais para RAG.
Um aviso sobre Markdown e tabelas complexas
Markdown é conveniente, legível e amplamente suportado. Não é sem perdas.
Docling documentação de serialização explica que as células da tabela mescladas são preservadas em JSON, DocLang, DocTags e HTML. As tabelas Markdown padrão não têm sintaxe para extensões de linhas ou colunas, portanto, esses relacionamentos são nivelados.
Se um fluxo de trabalho financeiro ou científico depende de cabeçalhos de vários níveis, não presuma que a exportação Markdown é a verdade. Mantenha o DoclingDocument ou o JSON sem perdas e use HTML ou um serializador personalizado onde a estrutura da tabela deve sobreviver.
Uma análise melhor realmente melhora o RAG?
Um estudo de 2026 oferece evidências úteis – não universais. Os investigadores compararam Docling, MinerU, Marker e DeepSeek OCR em 21 pipelines em 36 documentos administrativos portugueses. Nesse corpus, Docling com divisão hierárquica e descrições de imagens alcançou o resultado mais forte de resposta automatizada a perguntas, relatado como 94,1% ± 1,6%.
O resultado mais importante foi mais amplo: enriquecimento de metadados e fragmentação com reconhecimento de hierarquia contribuíram mais para a precisão do que o conversor sozinho, e as questões dependentes da tabela produziram as maiores lacunas. O estudo utilizou apenas 50 perguntas em um idioma e domínio, com um juiz LLM, portanto não deve ser lido como um placar universal. Isso reforça a lição arquitetônica: as opções de análise e agrupamento podem alterar materialmente as respostas que um sistema RAG recupera.
Docling x Unstructured x LlamaParse x Marker
Essas ferramentas se sobrepõem, mas não são produtos idênticos. A comparação mais útil começa com o modelo operacional e o fluxo de trabalho – não com uma única pontuação de precisão.
| Ferramenta | Modelo de entrega | Melhor ajuste | Compensação principal |
|---|---|---|---|
| Docling | Python de código aberto, CLI, API auto-hospedado | Ingestão local com reconhecimento de estrutura com um modelo de documento interno avançado | Você possui implantação, ajuste, artefatos de modelo e escalabilidade |
| Unstructured | Bibliotecas de código aberto mais uma plataforma ETL gerenciada | Amplos conectores de origem/destino e fluxos de trabalho de ingestão de produção | Maior área de superfície da plataforma; capacidades locais e gerenciadas devem ser avaliadas separadamente |
| LlamaParse | LlamaCloud hospedado API | Análise gerenciada de documentos difíceis com níveis de agente e instruções personalizadas | Custo de uso, limite de dados em nuvem e dependência de serviço |
| Marker | Conversor local de código aberto e opções gerenciadas do Datalab | Conversão rápida de PDF/documento para Markdown, JSON, HTML ou pedaços | Os modos de qualidade e hardware variam; licenciamento de peso de modelo precisa de revisão |
| PyMuPDF4LLM | Biblioteca local leve | Extração rápida e de baixa configuração em documentos que não precisam de um pipeline de visão mais pesado | Licenciamento AGPL/comercial e um modelo de documento de formato cruzado menos elaborado |
Docling vs.
Unstructured também particiona arquivos em elementos semânticos e oferece fragmentação com reconhecimento de estrutura. Seu maior diferencial é o ecossistema ETL circundante: conectores, pipelines, enriquecimentos, incorporação e operações gerenciadas para mover conteúdo das fontes aos destinos.
Escolha Docling quando uma camada de conversão Python local, um modelo de documento explícito e um pipeline de análise personalizável forem o centro do problema. Escolha Unstructured quando a sincronização contínua de muitos repositórios e destinos corporativos for tão importante quanto analisar cada arquivo. Ambos têm componentes de código aberto, portanto, uma verdadeira preparação pode começar localmente.
Docling vs.
LlamaParse faz parte do LlamaCloud, um serviço hospedado de processamento de documentos. Seu atual API oferece níveis rápidos, econômicos, agentic e agentic-plus, incluindo instruções em linguagem natural para análise mais difícil ou específica de domínio.
A decisão é em grande parte operacional. LlamaParse é atraente quando você deseja um endpoint gerenciado, capacidade elástica e análise sofisticada sem executar modelos por conta própria. Docling é atraente quando o controle local, o uso isolado, a propriedade previsível da infraestrutura e um pipeline de código aberto inspecionável são mais importantes. Se os documentos não puderem sair do seu ambiente, essa distinção poderá decidir a avaliação antes da precisão.
Docling vs.
Marker é outro forte conversor de documentos locais. Ele pode produzir Markdown, JSON, HTML e pedaços, e seu pipeline atual usa seletivamente processamento de visão para varreduras, equações e estruturas de baixa confiança. É um candidato natural quando a qualidade da conversão de PDF e a execução local são os principais requisitos.
Docling se destaca pelo ecossistema DoclingDocument mais amplo, proveniência, fragmentação nativa, pipelines configuráveis e superfície de integração. O código do Marker é Apache 2.0, mas seus pesos de modelo atuais têm uma licença separada baseada em OpenRAIL com limites comerciais. O núcleo do Docling é licenciado pelo MIT, embora licenças de modelo opcionais ainda devam ser verificadas. Nenhum dos resumos de licença substitui uma revisão legal para uma implantação comercial.
Docling vs.
PyMuPDF4LLM é intencionalmente leve. Ele usa o rápido mecanismo MuPDF, não requer GPU para seu fluxo de trabalho principal e pode emitir Markdown, JSON, texto e pedaços de página. Para uma coleção de PDFs limpos, ele pode fornecer exatamente o que você precisa com menos maquinário.
Docling faz mais sentido quando você deseja uma estrutura de formato cruzado mais rica, layout especializado e modelos de tabela, pipelines OCR/VLM comutáveis ou uma representação comum em muitos tipos de documentos. PyMuPDF4LLM tem licença dupla sob AGPL e uma licença comercial, o que também pode influenciar implantações proprietárias.
Onde Docling pode ter dificuldades
Docling é capaz, mas não torna a análise de documentos um problema resolvido.
- Páginas complexas ainda precisam de testes. Tabelas aninhadas, formulários incomuns, caligrafia, diagramas densos, digitalizações de baixa qualidade e camadas de texto quebradas podem confundir qualquer analisador.
- A instalação padrão não é pequena. Docling depende de Python e PyTorch, e os pipelines de PDF mais ricos precisam de pesos de modelo. Os downloads e inicializações a frio na primeira execução devem ser planejados.
- O processamento da CPU pode ser lento em escala. Local não significa automaticamente barato. Meça páginas por segundo, memória, tempo de fila e simultaneidade em seu hardware real.
- Formatos opcionais adicionam dependências. Arquivos legados do Office, vídeo, áudio e páginas da Apple requerem componentes extras.
- A escolha da saída pode remover a estrutura. Uma exportação Markdown conveniente pode nivelar as informações que o modelo interno preservou.
- O projeto avança rapidamente. Novos lançamentos chegam com frequência. Fixe versões e teste de regressão em um conjunto de documentos representativo antes de atualizar.
- É apenas a camada de ingestão. Você ainda precisa de incorporações, armazenamento, recuperação, controle de acesso, avaliação e uma estratégia de geração de respostas.
O roteiro oficial atualmente rotula a extração automática de metadados – como título, autores, referências e idioma – como disponível em breve. Se esses campos forem essenciais hoje, adicione sua própria etapa de extração e validação em vez de presumir que estão completos.
Quando você deve escolher Docling?
Docling merece um teste sério quando:
- os documentos devem ficar dentro da sua infraestrutura;
- tabelas, layout de página, hierarquia ou citações são importantes para recuperação;
- você precisa de um modelo de ingestão de PDFs, arquivos do Office, conteúdo da web, imagens, e-mail ou formatos especializados;
- sua equipe se sente confortável operando um serviço Python ou pipeline em lote;
- você deseja manter uma representação rica do documento em vez de apenas Markdown;
- você precisa de liberdade para alternar entre processamento nativo, padrão, OCR e VLM.
Um serviço gerenciado pode ser a melhor escolha quando você tem uma pequena equipe de engenharia, picos imprevisíveis ou nenhum desejo de operar uma infraestrutura de análise. Uma biblioteca mais leve pode ganhar quando quase todas as fontes são um PDF limpo e digital. O melhor analisador é o sistema menos complicado que preserva as informações das quais sua aplicação depende.
Como avaliar Docling em seus próprios documentos
- Crie um conjunto de testes difícil. Inclua páginas com várias colunas, digitalizações, páginas giradas, tabelas longas, células mescladas, gráficos, notas de rodapé e todos os idiomas importantes.
- Defina o que significa “correto”. Pontue a ordem de leitura, células da tabela, títulos, legendas, referências de páginas e omissões – não apenas a precisão dos caracteres.
- Compare pipelines. Teste a extração nativa, o pipeline de PDF padrão, as configurações OCR e um VLM somente onde a compreensão extra puder ajudar.
- Recuperação de teste de ponta a ponta. Faça perguntas cujas respostas dependam do layout e das tabelas. Verifique as evidências recuperadas antes de julgar a prosa final.
- Medir operações. Registre a latência, a taxa de transferência, a memória, o tamanho do download do modelo, as falhas e o custo de novas tentativas ou revisão humana.
- Mantenha um corpus dourado. Execute novamente os mesmos documentos e perguntas após cada alteração de analisador, modelo, chunker ou versão.
Não escolha um analisador em um documento de demonstração ou em um placar de fornecedor. Um arquivo de compras, uma biblioteca científica e um fluxo de trabalho de faturas podem produzir três vencedores diferentes.
Perguntas frequentes
Docling é um produto IBM?
Docling começou com a equipe de IA para conhecimento da IBM Research. Agora é um projeto de código aberto hospedado pela LF AI & Data Foundation, com a IBM ainda intimamente associada ao seu desenvolvimento e pesquisa.
O Docling é gratuito e de código aberto?
Sim. O código principal do Docling está disponível sob a licença do MIT. Modelos opcionais e componentes de terceiros podem ter seus próprios termos, portanto, verifique os artefatos exatos usados em sua implantação.
O Docling é executado localmente?
Sim. A execução local é um recurso central, e os artefatos do modelo podem ser pré-buscados para ambientes offline ou isolados. O envio de conteúdo para um serviço de modelo remoto requer aceitação explícita.
O Docling precisa de uma GPU?
Não, não para uso básico. Docling oferece suporte à execução de CPU e seu novo pipeline de PDF nativo não executa layout, OCR ou modelos de tabela. Uma GPU pode melhorar o rendimento para pipelines baseados em IA mais exigentes, especialmente em volume.
Docling é bom para RAG?
Sim, especialmente quando a recuperação depende da estrutura do documento. Seu modelo de documento unificado, origem, chunkers com reconhecimento de hierarquia e integrações de estrutura são projetados para ingestão de IA. Você ainda precisa avaliá-lo com seus arquivos e construir o restante da pilha de recuperação.
Qual é a diferença entre Docling e OCR?
OCR reconhece texto em imagens ou digitalizações. Docling pode usar OCR, mas também tenta entender a ordem de leitura, layout, tabelas, hierarquia, imagens e relacionamentos entre elementos. OCR é um estágio dentro de um fluxo de trabalho mais amplo de compreensão de documentos.
Docling é melhor que LlamaParse ou Unstructured?
Não em todas as situações. Docling é particularmente atraente para controle local e uma representação rica e estruturada. LlamaParse enfatiza um serviço gerenciado de análise de agente, enquanto Unstructured combina análise com um ETL mais amplo e uma plataforma de conector. Teste as ferramentas em relação aos mesmos documentos, questões posteriores e restrições operacionais.
Fontes e metodologia
Este artigo foi revisado em relação ao documentação oficial Docling, repositório de origem, Relatório técnico da IBM Researche Notas de versão v2.126.0. As comparações usam a documentação ou repositórios oficiais para Unstructured, LlamaParse, Markere PyMuPDF4LLM. As capacidades e licenças do produto podem mudar; verifique a documentação atual antes da implantação.
O resultado final
Docling é interessante porque trata a estrutura do documento como dados que vale a pena manter. Ele pode transformar muitos tipos de arquivos em uma representação comum e rastreável, executar localmente e entregar material mais limpo para os estágios de agrupamento e recuperação que se seguem.
Seus pontos fortes vêm com a responsabilidade: você opera o pipeline, escolhe o modo de processamento correto, preserva a saída correta e testa todas as classes de documentos difíceis. Para equipes que constroem RAG privado ou com muita estrutura, esse controle geralmente é o ponto. Para equipes que desejam que a análise desapareça atrás de um API gerenciado, outra ferramenta pode ser mais adequada.
A lição prática é mais simples do que o cenário de ferramentas: antes de alterar seu modelo de linguagem, inspecione o que seu analisador forneceu. Melhores respostas de IA geralmente começam com um documento melhor.


