• KI-Wissensdatenbank
  • KI-Tools
  • Künstliche Intelligenz

Was ist Docling? Ein praktischer Leitfaden zum Parsen von Dokumenten für RAG

Docling wandelt PDFs, Office-Dateien, Bilder, E-Mails und mehr in strukturierte Daten für die KI um. Erfahren Sie, wie es funktioniert, wo es in RAG passt und wie es im Vergleich zu anderen Dokumentparsern abschneidet.

Von Om KamathLesezeit: 15 Minuten
Docling-Dokument-KI-Illustration, die PDFs, Tabellenkalkulationen, Folien, E-Mails und Scans zeigt, die zu strukturiertem Inhalt für RAG werden

Docling kann eine unordentliche Datei in strukturierten, nachvollziehbaren Inhalt umwandeln, bevor Ihre KI ihn jemals sieht. Hier erfahren Sie, was das in der Praxis bedeutet – und wann ein anderer Parser möglicherweise die bessere Wahl ist.

Wenn ein RAG-Assistent die falsche Antwort gibt, ist das Sprachmodell ein leichtes Ziel. Aber viele Fehler passieren früher. Ein PDF wurde in der falschen Reihenfolge gelesen. Eine Tabelle wurde zu einem Durcheinander von Zahlen. In den Textkörper wurde eine Fußzeile eingefügt. Bis die Informationen das Modell erreichen, ist die Bedeutung bereits beschädigt.

Docling ist für diese erste, leicht zu übersehende Stufe konzipiert. Es wandelt Dokumente in eine strukturierte Darstellung um, die eine Anwendung exportieren, prüfen, segmentieren, einbetten und abrufen kann. Es ist lokal ausgerichtet, Open Source und flexibel genug, um alles zu verarbeiten, von einer sauberen Word-Datei bis hin zu einem gescannten Jahresbericht.

In diesem Leitfaden wird Docling im Klartext erklärt, gezeigt, wie es in eine RAG-Pipeline passt, und es mit Unstructured, LlamaParse, Marker und PyMuPDF4LLM verglichen. Das Ziel besteht nicht darin, einen einzigen Gewinner zu erklären. Es soll Ihnen dabei helfen, die richtige Aufnahmeschicht für die Dokumente auszuwählen, die Sie tatsächlich haben.

Aktualisierung vom 4. September 2026

Docling v2.126.0 wurde am 4. September 2026 veröffentlicht. Die wichtigste Ergänzung ist eine native PDF-Pipeline: ein schnellerer Pfad, der den eigenen Text und die Bilder einer PDF-Datei liest, ohne das Layout, OCR oder Tabellenmodelle auszuführen. Das gibt Teams eine nützliche Wahl: Nutzen Sie die native Extraktion für unkomplizierte digitale PDFs und die umfassendere KI-Pipeline, wenn es auf die Dokumentstruktur ankommt.

Was ist Docling?

Docling ist ein Open-Source-Toolkit zur Dokumentenkonvertierung, das von Forschern bei IBM entwickelt wurde und jetzt als Projekt der LF AI & Data Foundation gehostet wird. Es ist als Python-Bibliothek, Befehlszeilentool, selbstgehosteter API-Server und Integrationen für gängige KI-Frameworks verfügbar.

Seine Aufgabe besteht darin, Dateien, die für Menschen entwickelt wurden – PDFs, Word-Dokumente, Präsentationen, Tabellenkalkulationen, Bilder, E-Mails, Webseiten und mehr – in Daten umzuwandeln, die von der Software verstanden werden können. Der Beamte Docling-Dokumentation beschreibt die erweiterte PDF-Unterstützung für Seitenlayout, Lesereihenfolge, Tabellen, Code, Formeln, Bilder und OCR.

Docling ist nicht eine Vektordatenbank, ein Einbettungsmodell oder eine vollständige RAG-Anwendung. Es bereitet das Quellmaterial für diese Systeme vor. Betrachten Sie es als die Brücke zwischen „wir haben 20.000 Geschäftsdateien“ und „unsere KI kann zuverlässig durchsuchen, was sich darin befindet“.

FrageKurze Antwort
Wer hat Docling gegründet?Das AI for Knowledge-Team von IBM Research
Ist es Open Source?Ja. Der Kerncode ist MIT-lizenziert; Überprüfen Sie die Lizenzen der optionalen Modelle, die Sie bereitstellen.
Kann es lokal ausgeführt werden?Ja, einschließlich Offline- und Air-Gap-Umgebungen, nachdem Modellartefakte vorab abgerufen wurden.
Was produziert es?Eine strukturierte DoclingDocument, mit Exporten wie Markdown, HTML, Text, DocTags und verlustfreiem JSON.
Wofür ist es am besten?Dokumentenaufnahme, KI-Suche, RAG, Extraktionsworkflows und Agenten, die einen fundierten Dokumentkontext benötigen.

Warum Docling mehr ist als ein PDF-zu-Markdown-Tool

Der einfachste Weg, Docling zu verstehen, besteht darin, zwei mögliche Ausgaben derselben Seite zu vergleichen.

Ein einfacher Textextraktor könnte jedes sichtbare Wort als eine lange Zeichenfolge zurückgeben. Das kann für ein einfaches Memo funktionieren. Bei einer zweispaltigen Forschungsarbeit, einem Finanzbericht mit zusammengeführten Kopfzeilen oder einem Formular, bei dem die Position eines Werts angibt, was der Wert bedeutet, funktioniert dies weitaus weniger gut.

Docling erstellt zunächst a DoclingDocument. Dieses einheitliche Dokumentmodell kann Folgendes darstellen:

  • Text, Tabellen, Bilder und Schlüsselwertelemente;
  • Abschnitte, Gruppen und die Dokumenthierarchie;
  • die vorgesehene Lesereihenfolge;
  • Kopf- und Fußzeilen getrennt vom Hauptteil;
  • Seitenpositionen und Begrenzungsrahmen, sofern verfügbar;
  • Herkunft, die ein extrahiertes Element mit seiner Quelle verbindet.

Diese Unterscheidung ist wichtig. Markdown ist eine nützliche Ansicht eines Dokuments; es ist nicht das Dokumentmodell selbst. Eine Anwendung kann die umfassendere Darstellung für Zitate und Validierungen beibehalten und dann die jeweilige Ausgabe erzeugen, die jeder nachgelagerte Schritt benötigt.

Diagramm, das zeigt, wie sich Quelldateien über Docling in einen strukturierten DoclingDocument- und dann in einen RAG-Stack bewegen
Docling übernimmt die Dokumentkonvertierung und -struktur. Chunking, Einbettungen, Indizierung, Abruf und Generierung bleiben separate Entscheidungen.

Wie Docling funktioniert, ohne Fachjargon

  1. Sie geben ihm eine Datei oder URL. Die DocumentConverter identifiziert das Format und wählt ein geeignetes Backend und eine geeignete Verarbeitungspipeline aus.
  2. Es liest sowohl Inhalt als auch Struktur. Je nach Datei und Konfiguration kann Docling nativen Text, Layoutanalyse, Tabellenerkennung, OCR oder ein Vision-Language-Modell verwenden.
  3. Es baut einen DoclingDocument. Der Text wird neben Tabellen, Bildern, Hierarchie, Seitengeometrie und Quellinformationen organisiert.
  4. Sie entscheiden, was als nächstes passiert. Exportieren Sie nach Markdown oder HTML, serialisieren Sie nach JSON, erstellen Sie RAG-Blöcke, senden Sie das Ergebnis an ein anderes Framework oder machen Sie die Konvertierung über ein API verfügbar.

Dieses modulare Design ist eine der stärksten Ideen von Docling. Ein sauberes digitales PDF erfordert nicht immer die gleiche aufwendige visuelle Bearbeitung wie ein verblasster Scan. Für eine Forschungsarbeit sind möglicherweise Formeln und Lesereihenfolge erforderlich, während es bei einem Rechnungsworkflow möglicherweise mehr um Tabellen und Schlüssel-Wert-Paare geht.

Welche Dateiformate unterstützt Docling?

Der Strom Referenz zu unterstützten Formaten deckt eine überraschend breite Mischung ab:

  • Dokumente: PDF, DOCX, ältere Word-Dateien, OpenDocument-Text, Markdown, AsciiDoc, LaTeX, HTML und EPUB;
  • Tabellenkalkulationen und Präsentationen: XLSX, PPTX, ältere Microsoft Office-Formate, ODS, ODP, CSV und Apple Pages;
  • Visuelle Medien: PNG, JPEG, TIFF, BMP und WebP;
  • Kommunikation und Medien: EML, MSG, Box Notes, Audio-, Videotranskripte und WebVTT;
  • Spezialisierte Daten: JATS, XBRL, USPTO XML, EBCDIC, DocLang und Docling JSON.

Einige Formate erfordern optionale Pakete oder Systemtools. Für ältere Office-Dokumente ist LibreOffice erforderlich, für Audio und Video ist das ASR-Extra erforderlich, für Videos ist FFmpeg erforderlich und für Apple Pages ist zusätzlich das iWork-Format erforderlich. Mit anderen Worten bedeutet „unterstützt“ nicht immer „in der kleinsten Standardinstallation enthalten“.

Fünf Gründe, warum Docling für RAG attraktiv ist

1. Es behält mehr von der Bedeutung des Dokuments bei

RAG funktioniert am besten, wenn Chunks kohärente Ideen enthalten. Seitenhierarchie, Beschriftungen, Tabellenüberschriften und Lesereihenfolge stellen Kontext bereit, den eine willkürliche Zeichenaufteilung nicht wiederherstellen kann. Die nativen Chunker von Docling bearbeiten die Dokumentstruktur, anstatt Sie zu zwingen, zuerst alles zu reduzieren.

2. Die lokale Verarbeitung ist eine erstklassige Option

Die Hauptpipelines von Docling können auf Ihrem eigenen Computer oder Ihrer eigenen Infrastruktur ausgeführt werden. Das ist wertvoll für Verträge, Krankenakten, interne Berichte und andere sensible Materialien. Die Leitfaden für erweiterte Optionen sagt, dass Remote-Dienste ein explizites Opt-in erfordern; andernfalls verhindert Docling diesen Vorgang.

Es gibt eine wichtige Nuance: Die lokale Verarbeitung kann immer noch Modellgewichte herunterladen, wenn Sie die PDF-Pipeline zum ersten Mal verwenden. Für eine echte Offline-Bereitstellung rufen Sie die erforderlichen Artefakte vorab ab, speichern Sie sie intern und verweisen Sie Docling auf diesen Pfad.

3. Sie können zwischen Geschwindigkeit und umfassenderem Verständnis wählen

Docling ist nicht an eine Analysemethode gebunden. Die Standard-PDF-Pipeline kombiniert spezielle Phasen für Layout und Tabellen. VLM-Pipelines können Seiten durchgängig interpretieren. Die neue native PDF-Pipeline überspringt KI-Modelle, wenn die direkte Extraktion ausreicht. Dadurch ist es möglich, einfache und schwierige Dokumente unterschiedlich weiterzuleiten, anstatt für jede Seite die gleichen Rechenkosten zu zahlen.

4. Das Chunking versteht die Dokumentstruktur

Die HybridChunker beginnt mit hierarchischen Dokumentelementen, teilt dann übergroße Teile auf und führt kompatible kleine Teile gemäß einem Tokenizer zusammen. Es kann auch Tabellenüberschriften wiederholen, wenn eine Tabelle mehrere Blöcke umfasst. Dies entspricht viel mehr dem Verständnis eines Lesers für einen Bericht als „alle 500 Zeichen aufteilen“.

5. Es passt in einen vorhandenen KI-Stack

Docling listet Integrationen mit LangChain, LlamaIndex, Haystack, CrewAI, Vektordatenbanken und anderen KI-Tools auf. Teams können es direkt aus Python aufrufen und ausführen docling-servieren B. hinter einem HTTP-Endpunkt, verwenden Sie verteilte Batch-Tools oder stellen Sie die Dokumentkonvertierung Agenten zur Verfügung.

So installieren und verwenden Sie Docling

Das aktuelle Paket unterstützt Python 3.10 oder neuer. Die einfachste Installation ist:

pip install docling

Konvertieren Sie dann eine lokale Datei oder URL und exportieren Sie sie nach Markdown:

from docling.document_converter import DocumentConverter

converter = DocumentConverter()
document = converter.convert("annual-report.pdf").document

markdown = document.export_to_markdown()
print(markdown)

Der entsprechende Befehlszeilen-Workflow ist genauso direkt:

docling annual-report.pdf

Das reicht für einen ersten Test. Konfigurieren Sie für die Produktion zulässige Formate, Seiten- und Dateigrößenbeschränkungen, OCR-Sprachen, Rechenressourcen, Zeitüberschreitungen und Modellspeicher, anstatt sich auf alle Standardeinstellungen zu verlassen.

Verwendung von Docling für RAG

Ein häufiger Fehler besteht darin, Markdown zu exportieren und es sofort nach Zeichenanzahl aufzuteilen. Dadurch wird ein Teil der Struktur verworfen, an deren Wiederherstellung Docling gearbeitet hat. Beginnen Sie für RAG mit dem Testen eines nativen Chunkers:

from docling.chunking import HybridChunker
from docling.document_converter import DocumentConverter

document = DocumentConverter().convert("annual-report.pdf").document
chunker = HybridChunker()

texts_for_embedding = [
    chunker.contextualize(chunk)
    for chunk in chunker.chunk(dl_doc=document)
]

contextualize() Fügt dem eingebetteten Text nützliche Metadaten wie Überschriften oder Bildunterschriften hinzu. Docling empfiehlt, den Tokenizer des Chunkers an das Einbettungsmodell anzupassen, wenn Token-Grenzwerte wichtig sind.

Von da an ist der Ablauf vertraut: Betten Sie den Blocktext ein, speichern Sie Vektoren und Metadaten, rufen Sie relevante Blöcke ab, ordnen Sie sie optional neu und geben Sie die besten Beweise an ein Generierungsmodell weiter. Eine umfassendere architektonische Erklärung finden Sie in unserem Leitfaden zu RAG und abruferweiterte Generierung und unser Vergleich von Vektordatenbanken für RAG.

Eine Warnung zu Markdown und komplexen Tabellen

Markdown ist praktisch, lesbar und wird weitgehend unterstützt. Es ist nicht verlustfrei.

Docling’s Serialisierungsdokumentation erklärt, dass zusammengeführte Tabellenzellen in JSON, DocLang, DocTags und HTML erhalten bleiben. Standard-Markdown-Tabellen haben keine Syntax für Zeilen- oder Spaltenbereiche, daher sind diese Beziehungen abgeflacht.

Wenn ein finanzieller oder wissenschaftlicher Arbeitsablauf von mehrstufigen Headern abhängt, gehen Sie nicht davon aus, dass der Markdown-Export die Grundwahrheit ist. Behalten Sie DoclingDocument oder das verlustfreie JSON bei und verwenden Sie HTML oder einen benutzerdefinierten Serialisierer, bei dem die Tabellenstruktur erhalten bleiben muss.

Verbessert eine bessere Analyse tatsächlich RAG?

Eine Studie aus dem Jahr 2026 liefert nützliche – nicht universelle – Beweise. Die Forscher verglichen Docling, MinerU, Marker und DeepSeek OCR in 21 Pipelines anhand von 36 portugiesischen Verwaltungsdokumenten. In diesem Korpus erzielte Docling mit hierarchischer Aufteilung und Bildbeschreibungen das stärkste automatisierte Frage-Antwort-Ergebnis, das mit 94,1 % ± 1,6 % angegeben wurde.

Das wichtigere Ergebnis war umfassender: Metadatenanreicherung und hierarchiebewusstes Chunking trug mehr zur Genauigkeit bei als der Konverter allein, und tabellenabhängige Fragen führten zu den größten Lücken. In der Studie wurden nur 50 Fragen in einer Sprache und einem Bereich mit einem LLM-Richter verwendet, daher sollte sie nicht als universelle Bestenliste gelesen werden. Es unterstreicht die architektonische Lektion: Parsing- und Chunking-Entscheidungen können die Antworten, die ein RAG-System abruft, erheblich verändern.

Docling vs. Unstructured vs. LlamaParse vs. Marker

Diese Tools überschneiden sich, es handelt sich jedoch nicht um identische Produkte. Der nützlichste Vergleich beginnt mit dem Betriebsmodell und dem Arbeitsablauf – nicht mit einer einzigen Genauigkeitsbewertung.

WerkzeugLiefermodellBeste PassformHauptkompromiss
DoclingOpen-Source-Python, CLI, selbstgehostetes APILokale, strukturbewusste Aufnahme mit einem umfangreichen internen DokumentmodellSie sind für die Bereitstellung, Optimierung, Modellartefakte und Skalierung verantwortlich
UnstructuredOpen-Source-Bibliotheken plus eine verwaltete ETL-PlattformUmfangreiche Quell-/Ziel-Konnektoren und Arbeitsabläufe zur ProduktionsaufnahmeMehr Plattformfläche; Lokale und verwaltete Funktionen müssen separat bewertet werden
LlamaParseGehostet von LlamaCloud APIVerwaltetes Parsen schwieriger Dokumente mit Agentenebenen und benutzerdefinierten AnweisungenNutzungskosten, Cloud-Datengrenze und Dienstabhängigkeit
MarkerLokaler Open-Source-Konverter plus verwaltete Datalab-OptionenSchnelle PDF-/Dokumentkonvertierung in Markdown, JSON, HTML oder ChunksQualität und Hardwaremodi variieren; Modellgewichtslizenzierung muss überprüft werden
PyMuPDF4LLMLeichte lokale BibliothekSchnelle Extraktion mit geringem Einrichtungsaufwand für Dokumente, die keine umfangreichere Vision-Pipeline benötigenAGPL/kommerzielle Lizenzierung und ein weniger ausgefeiltes formatübergreifendes Dokumentenmodell

Docling vs. Unstructured

Unstructured Partitioniert Dateien auch in semantische Elemente und bietet strukturbewusstes Chunking. Sein größeres Unterscheidungsmerkmal ist das umgebende ETL-Ökosystem: Konnektoren, Pipelines, Anreicherungen, Einbettungen und verwaltete Vorgänge zum Verschieben von Inhalten von Quellen zu Zielen.

Wählen Sie Docling, wenn eine lokale Python-Konvertierungsebene, ein explizites Dokumentmodell und eine anpassbare Parsing-Pipeline im Mittelpunkt des Problems stehen. Wählen Sie Unstructured, wenn die kontinuierliche Synchronisierung vieler Unternehmens-Repositorys und -Ziele genauso wichtig ist wie das Parsen jeder Datei. Beide verfügen über Open-Source-Komponenten, sodass ein echter Bake-off vor Ort beginnen kann.

Docling vs. LlamaParse

LlamaParse ist Teil von LlamaCloud, einem gehosteten Dokumentenverarbeitungsdienst. Sein aktueller API bietet schnelle, kostengünstige, Agentic- und Agentic-Plus-Stufen, einschließlich Anweisungen in natürlicher Sprache für anspruchsvolleres oder domänenspezifisches Parsen.

Die Entscheidung ist weitgehend operativ. LlamaParse ist attraktiv, wenn Sie einen verwalteten Endpunkt, elastische Kapazität und anspruchsvolles Parsing wünschen, ohne selbst Modelle ausführen zu müssen. Docling ist attraktiv, wenn lokale Kontrolle, Air-Gap-Nutzung, vorhersehbarer Infrastrukturbesitz und eine überprüfbare Open-Source-Pipeline wichtiger sind. Wenn Dokumente Ihre Umgebung nicht verlassen können, entscheidet möglicherweise diese Unterscheidung über die Bewertung, bevor die Genauigkeit dies tut.

Docling vs. Marker

Marker ist ein weiterer starker lokaler Dokumentenkonverter. Es kann Markdown, JSON, HTML und Chunks erzeugen und seine aktuelle Pipeline nutzt selektiv die Bildverarbeitung für Scans, Gleichungen und Strukturen mit geringem Vertrauen. Es ist ein natürlicher Kandidat, wenn die Qualität der PDF-Konvertierung und die lokale Ausführung die Hauptanforderungen sind.

Docling zeichnet sich durch das breitere DoclingDocument-Ökosystem, Herkunft, natives Chunking, konfigurierbare Pipelines und Integrationsoberfläche aus. Der Code von Marker lautet Apache 2.0, aber die aktuellen Modellgewichte verfügen über eine separate OpenRAIL-basierte Lizenz mit kommerziellen Schwellenwerten. Der Kern von Docling ist MIT-lizenziert, optionale Modelllizenzen sollten jedoch dennoch überprüft werden. Keine der Lizenzzusammenfassungen ersetzt eine rechtliche Prüfung für eine kommerzielle Bereitstellung.

Docling vs. PyMuPDF4LLM

PyMuPDF4LLM ist bewusst leichtgewichtig. Es nutzt die schnelle MuPDF-Engine, benötigt für seinen Kernworkflow keine GPU und kann Markdown-, JSON-, Text- und Seitenblöcke ausgeben. Für eine Sammlung sauberer PDFs kann es mit weniger Maschinenaufwand genau das liefern, was Sie benötigen.

Docling ist sinnvoller, wenn Sie eine umfassendere formatübergreifende Struktur, spezielle Layout- und Tabellenmodelle, umschaltbare OCR/VLM-Pipelines oder eine gemeinsame Darstellung für viele Dokumenttypen wünschen. PyMuPDF4LLM ist unter AGPL und einer kommerziellen Lizenz doppelt lizenziert, was auch Auswirkungen auf proprietäre Bereitstellungen haben kann.

Wo Docling Schwierigkeiten haben kann

Docling ist dazu in der Lage, macht das Parsen von Dokumenten jedoch nicht zu einem gelösten Problem.

  • Komplexe Seiten müssen noch getestet werden. Verschachtelte Tabellen, ungewöhnliche Formen, Handschrift, dichte Diagramme, minderwertige Scans und unterbrochene Textebenen können jeden Parser verwirren.
  • Die Standardinstallation ist nicht winzig. Docling hängt von Python und PyTorch ab und die umfangreicheren PDF-Pipelines benötigen Modellgewichte. Erstmalige Downloads und Kaltstarts sollten eingeplant werden.
  • Die CPU-Verarbeitung kann im großen Maßstab langsam sein. Lokal bedeutet nicht automatisch günstig. Messen Sie Seiten pro Sekunde, Speicher, Warteschlangenzeit und Parallelität auf Ihrer echten Hardware.
  • Optionale Formate fügen Abhängigkeiten hinzu. Für ältere Office-Dateien, Video, Audio und Apple Pages sind zusätzliche Komponenten erforderlich.
  • Die Auswahl der Ausgabe kann Struktur entfernen. Ein praktischer Markdown-Export kann Informationen reduzieren, die das interne Modell beibehalten hat.
  • Das Projekt schreitet schnell voran. Neue Veröffentlichungen kommen häufig. Pin-Versionen und Regressionstest eines repräsentativen Dokumentensatzes vor dem Upgrade.
  • Es handelt sich lediglich um die Aufnahmeschicht. Sie benötigen weiterhin Einbettungen, Speicherung, Abruf, Zugriffskontrolle, Auswertung und eine Strategie zur Antwortgenerierung.

Die offizielle Roadmap sieht derzeit vor, dass die automatische Extraktion von Metadaten – wie Titel, Autoren, Referenzen und Sprache – bald verfügbar sein wird. Wenn diese Felder heute unerlässlich sind, fügen Sie Ihren eigenen Extraktions- und Validierungsschritt hinzu, anstatt davon auszugehen, dass sie vollständig sind.

Wann sollten Sie sich für Docling entscheiden?

Docling verdient eine ernsthafte Prüfung, wenn:

  • Dokumente müssen in Ihrer Infrastruktur bleiben;
  • Tabellen, Seitenlayout, Hierarchie oder Zitate sind für den Abruf von Bedeutung;
  • Sie benötigen ein einziges Aufnahmemodell für PDFs, Office-Dateien, Webinhalte, Bilder, E-Mails oder spezielle Formate.
  • Ihr Team ist mit der Bedienung eines Python-Dienstes oder einer Batch-Pipeline vertraut;
  • Sie möchten eine umfangreiche Dokumentdarstellung statt nur Markdown beibehalten;
  • Sie benötigen die Freiheit, zwischen nativer, Standard-, OCR- und VLM-Verarbeitung zu wechseln.

Ein verwalteter Dienst kann die bessere Wahl sein, wenn Sie ein kleines Technikteam haben, unvorhersehbare Spitzen haben oder keine Lust haben, eine Parsing-Infrastruktur zu betreiben. Eine leichtere Bibliothek kann gewinnen, wenn fast jede Quelle ein sauberes, digitalisiertes PDF ist. Der beste Parser ist das am wenigsten komplizierte System, das die Informationen bewahrt, von denen Ihre Anwendung abhängt.

So bewerten Sie Docling anhand Ihrer eigenen Dokumente

  1. Erstellen Sie einen schwierigen Testsatz. Fügen Sie mehrspaltige Seiten, Scans, gedrehte Seiten, lange Tabellen, verbundene Zellen, Diagramme, Fußnoten und alle wichtigen Sprachen hinzu.
  2. Definieren Sie, was „richtig“ bedeutet. Bewerten Sie Lesereihenfolge, Tabellenzellen, Überschriften, Bildunterschriften, Seitenverweise und Auslassungen – nicht nur die Zeichengenauigkeit.
  3. Vergleichen Sie Pipelines. Testen Sie die native Extraktion, die Standard-PDF-Pipeline, die OCR-Einstellungen und einen VLM nur dort, wo das zusätzliche Verständnis hilfreich sein kann.
  4. Testabruf End-to-End. Stellen Sie Fragen, deren Antworten vom Layout und den Tabellen abhängen. Überprüfen Sie die gefundenen Beweise, bevor Sie über die endgültige Prosa urteilen.
  5. Messvorgänge. Zeichnen Sie Latenz, Durchsatz, Speicher, Modell-Download-Größe, Fehler und die Kosten für Wiederholungsversuche oder menschliche Überprüfungen auf.
  6. Behalten Sie einen goldenen Korpus. Führen Sie dieselben Dokumente und Fragen nach jeder Parser-, Modell-, Chunker- oder Versionsänderung erneut aus.

Wählen Sie einen Parser nicht aus einem Demodokument oder einer Anbieter-Bestenliste aus. Ein Beschaffungsarchiv, eine wissenschaftliche Bibliothek und ein Rechnungsworkflow können drei verschiedene Gewinner hervorbringen.

Häufig gestellte Fragen

Ist Docling ein IBM-Produkt?

Docling begann mit dem AI for Knowledge-Team von IBM Research. Mittlerweile handelt es sich um ein Open-Source-Projekt, das von der LF AI & Data Foundation gehostet wird, wobei IBM immer noch eng mit seiner Entwicklung und Forschung verbunden ist.

Ist Docling kostenlos und Open Source?

Ja. Der Kerncode von Docling ist unter der MIT-Lizenz verfügbar. Optionale Modelle und Komponenten von Drittanbietern können ihre eigenen Bedingungen haben. Überprüfen Sie daher die genauen Artefakte, die in Ihrer Bereitstellung verwendet werden.

Läuft Docling lokal?

Ja. Die lokale Ausführung ist eine Kernfunktion, und Modellartefakte können für Offline- oder Air-Gap-Umgebungen vorab abgerufen werden. Das Senden von Inhalten an einen Remote-Modelldienst erfordert eine explizite Einwilligung.

Benötigt Docling eine GPU?

Nein, nicht für den Grundgebrauch. Docling unterstützt die CPU-Ausführung und seine neue native PDF-Pipeline führt weder Layout-, OCR- noch Tabellenmodelle aus. Eine GPU kann den Durchsatz für anspruchsvollere KI-basierte Pipelines verbessern, insbesondere bei hoher Lautstärke.

Ist Docling gut für RAG?

Ja, insbesondere wenn der Abruf von der Dokumentstruktur abhängt. Sein einheitliches Dokumentmodell, seine Herkunft, hierarchiebewusste Chunker und Framework-Integrationen sind für die KI-Aufnahme konzipiert. Sie müssen es noch mit Ihren Dateien auswerten und den Rest des Abrufstapels erstellen.

Was ist der Unterschied zwischen Docling und OCR?

OCR erkennt Text in Bildern oder Scans. Docling kann OCR verwenden, versucht aber auch, Lesereihenfolge, Layout, Tabellen, Hierarchie, Bilder und Beziehungen zwischen Elementen zu verstehen. OCR ist eine Stufe innerhalb eines umfassenderen Dokumentenverständnis-Workflows.

Ist Docling besser als LlamaParse oder Unstructured?

Nicht in jeder Situation. Docling überzeugt besonders durch die lokale Steuerung und eine reichhaltige strukturierte Darstellung. LlamaParse legt den Schwerpunkt auf einen verwalteten Agenten-Parsing-Dienst, während Unstructured Parsing mit einer breiteren ETL- und Connector-Plattform kombiniert. Testen Sie die Tools anhand derselben Dokumente, nachgelagerten Fragen und Betriebsbeschränkungen.

Quellen und Methodik

Dieser Artikel wurde gegen überprüft offizielle Docling-Dokumentation, Quell-Repository, Technischer Bericht von IBM Research, und Versionshinweise zu v2.126.0. Vergleiche verwenden die offizielle Dokumentation oder Repositories für Unstructured, LlamaParse, Marker, und PyMuPDF4LLM. Produktfunktionen und Lizenzen können sich ändern; Überprüfen Sie vor der Bereitstellung die aktuelle Dokumentation.

Das Endergebnis

Docling ist interessant, weil es die Dokumentstruktur als Daten behandelt, die es wert sind, aufbewahrt zu werden. Es kann viele Dateitypen in eine gemeinsame, nachvollziehbare Darstellung umwandeln, lokal ausführen und Material von Hand bereinigen, um es den folgenden Chunking- und Abrufphasen zuzuführen.

Seine Stärken gehen mit Verantwortung einher: Sie betreiben die Pipeline, wählen den richtigen Verarbeitungsmodus, sorgen für die richtige Ausgabe und testen jede schwierige Dokumentklasse. Für Teams, die private oder strukturintensive RAG erstellen, ist diese Kontrolle oft der Punkt. Für Teams, die möchten, dass das Parsing hinter einem verwalteten API verschwindet, ist möglicherweise ein anderes Tool besser geeignet.

Die praktische Lektion ist einfacher als die Tool-Landschaft: Bevor Sie Ihr Sprachmodell ändern, überprüfen Sie, was Ihr Parser ihm gegeben hat. Bessere KI-Antworten beginnen oft mit einem besseren Dokument.

Ihr erster Assistent ist nur wenige Minuten entfernt

Setzen Sie Ihr betriebswirtschaftliches Wissen ein.

Beginnen Sie mit einem kostenlosen Cody-Konto. Fügen Sie Ihre Inhalte hinzu, erstellen Sie einen Assistenten und teilen Sie noch heute die erste nützliche Antwort.