- AI ナレッジベース
- AIツール
- 人工知能
Doclingとは何ですか? RAG のドキュメント解析の実践ガイド
Docling は、PDF、Office ファイル、画像、電子メールなどを AI 用の構造化データに変換します。これがどのように機能するか、RAG のどこに適合するか、他のドキュメント パーサーとどのように比較するかを学びます。

Docling は、AI が認識する前に、乱雑なファイルを構造化された追跡可能なコンテンツに変換できます。これが実際に何を意味するのか、また、別のパーサーの方が適切な選択となる場合は次のとおりです。
RAG アシスタントが間違った答えをした場合、言語モデルは格好の標的になります。しかし、多くの失敗はそれ以前に起こります。 PDF が間違った順序で読み取られました。表は数字のごちゃ混ぜになった。フッターが本文に混在しました。情報がモデルに到達するまでに、その意味はすでに損なわれています。
Docling は、見落とされがちな最初の段階向けに構築されています。 ドキュメントを、アプリケーションがエクスポート、検査、チャンク化、埋め込み、取得できる構造化表現に変換します。これはローカルファーストでオープンソースであり、クリーンな Word ファイルからスキャンされた年次報告書まであらゆるものを処理できる柔軟性があります。
このガイドでは、Docling について平易な英語で説明し、RAG パイプラインにどのように適合するかを示し、Unstructured、LlamaParse、Marker、および PyMuPDF4LLM と比較します。目標は、1 人の普遍的な勝者を宣言することではありません。これは、実際に所有しているドキュメントに適切な取り込みレイヤーを選択するのに役立ちます。
2026 年 9 月 4 日更新
Docling v2.126.0 は2026年9月4日にリリースされました。見出しとして追加されたのは、ネイティブ PDF パイプラインです。これは、レイアウト、OCR、またはテーブル モデルを実行せずに、PDF 自体のテキストと画像を読み取る高速パスです。これにより、チームは、簡単なボーンデジタル PDF にはネイティブ抽出を使用し、ドキュメント構造が重要な場合にはより完全な AI パイプラインを使用するという、有益な選択肢を得ることができます。
Doclingとは何ですか?
Docling は、IBM の研究者によって作成されたオープンソースのドキュメント変換ツールキットで、現在は LF AI & Data Foundation のプロジェクトとしてホストされています。 これは、Python ライブラリ、コマンドライン ツール、セルフホスト型 API サーバー、および一般的な AI フレームワークの統合として利用できます。
その仕事は、人間向けに設計されたファイル (PDF、Word 文書、プレゼンテーション、スプレッドシート、画像、電子メール、Web ページなど) を取得し、ソフトウェアが理解できるデータに変換することです。役人 Docling ドキュメント ページ レイアウト、読み取り順序、表、コード、数式、画像、および OCR に対する高度な PDF サポートについて説明します。
Doclingは そうではない ベクトル データベース、埋め込みモデル、または完全な RAG アプリケーション。それらのシステムのソースマテリアルを準備します。これは、「当社には 20,000 件のビジネス ファイルがある」ことと、「当社の AI はそのファイルの中にあるものを確実に検索できる」間の架け橋と考えてください。
| 質問 | 短い答え |
|---|---|
| Docling を始めたのは誰ですか? | IBM ResearchのAI forKnowledgeチーム |
| オープンソースですか? | はい。コア コードは MIT ライセンスを取得しています。導入するオプションモデルのライセンスを確認してください。 |
| ローカルで実行できますか? | はい、モデル アーティファクトがプリフェッチされた後のオフラインおよびエアギャップ環境を含みます。 |
| それは何を生み出すのでしょうか? | 構造化された DoclingDocument、Markdown、HTML、テキスト、DocTags、ロスレス JSON などのエクスポートを使用します。 |
| 何に最適ですか? | ドキュメントの取り込み、AI 検索、RAG、抽出ワークフロー、および根拠のあるドキュメント コンテキストを必要とするエージェント。 |
Docling が単なる PDF から Markdown ツールにとどまらない理由
Docling を理解する最も簡単な方法は、同じページからの 2 つの出力を比較することです。
基本的なテキスト抽出プログラムは、表示されるすべての単語を 1 つの長い文字列として返す場合があります。簡単なメモには使えます。 2 列の研究論文、ヘッダーが結合された財務諸表、または値の位置によって値の意味がわかるフォームでは、この方法はあまりうまく機能しません。
Docling は最初に DoclingDocument。この統一されたドキュメント モデルは以下を表すことができます。
- テキスト、表、画像、および Key-Value 項目。
- セクション、グループ、ドキュメント階層。
- 意図された読み取り順序。
- ヘッダーとフッターは本体とは別に作成されます。
- ページの位置と境界ボックス (利用可能な場合)。
- 抽出された要素をそのソースに結び付ける来歴。
その区別が重要です。 Markdown は、ドキュメントの便利なビューの 1 つです。それは文書モデルそのものではありません。アプリケーションは、引用と検証のためのより豊富な表現を保持し、下流の各ステップで必要な特定の出力を生成できます。
専門用語を使わずに Docling がどのように機能するか
- ファイルまたは URL を指定します。 の
DocumentConverter形式を識別し、適切なバックエンドと処理パイプラインを選択します。 - 内容と構造の両方を読み取ります。 ファイルと構成に応じて、Docling はネイティブ テキスト、レイアウト分析、表認識、OCR、またはビジョン言語モデルを使用できます。
- DoclingDocument を構築します。 テキストは、表、画像、階層、ページ形状、ソース情報と並んで編成されています。
- 次に何が起こるかを選択するのはあなたです。 Markdown または HTML へのエクスポート、JSON へのシリアル化、RAG チャンクの作成、結果の別のフレームワークへの送信、または API を介した変換の公開を行います。
このモジュラー設計は、Docling の最も強力なアイデアの 1 つです。きれいなデジタル PDF は、色あせたスキャンと同じ高価な視覚処理を必ずしも必要とするわけではありません。研究論文には数式と読み上げ順序が必要な場合がありますが、請求書のワークフローではテーブルとキーと値のペアがより重要になる場合があります。
Docling はどのようなファイル形式をサポートしていますか?
現在の サポートされている形式のリファレンス 驚くほど幅広いミックスをカバーしています。
- 書類: PDF、DOCX、従来の Word ファイル、OpenDocument テキスト、Markdown、AsciiDoc、LaTeX、HTML、および EPUB。
- スプレッドシートとプレゼンテーション: XLSX、PPTX、古い Microsoft Office 形式、ODS、ODP、CSV、および Apple Pages。
- ビジュアルメディア: PNG、JPEG、TIFF、BMP、WebP。
- コミュニケーションとメディア: EML、MSG、Box Notes、オーディオ、ビデオトランスクリプト、WebVTT。
- 特殊なデータ: JATS、XBRL、USPTO XML、EBCDIC、DocLang、および Docling JSON。
一部の形式では、オプションのパッケージまたはシステム ツールが必要です。従来の Office ドキュメントには LibreOffice が必要で、オーディオとビデオには追加の ASR が必要で、ビデオには FFmpeg が必要で、Apple Pages には追加の iWork 形式が必要です。言い換えれば、「サポートされている」ということは、必ずしも「最小のデフォルトのインストールに含まれている」ということを意味するわけではありません。
Docling が RAG にとって魅力的な 5 つの理由
1. 文書の意味をより多く保持する
RAG は、チャンクに一貫したアイデアが含まれている場合に最適に機能します。ページ階層、キャプション、表ヘッダー、および読み取り順序は、任意の文字分割では回復できないコンテキストを提供します。 Docling のネイティブ チャンカーは、最初にすべてをフラット化することを強制するのではなく、ドキュメント構造に基づいて動作します。
2. ローカル処理は第一級のオプションです
Docling のメイン パイプラインは、独自のマシンまたはインフラストラクチャ上で実行できます。これは、契約書、医療記録、内部報告書、その他の機密資料にとって貴重です。の 高度なオプション ガイド リモートサービスには明示的なオプトインが必要であると述べています。それ以外の場合、Docling によりその操作が妨げられます。
重要なニュアンスがあります。PDF パイプラインを初めて使用するときに、ローカル処理でもモデルの重みをダウンロードできるということです。真のオフライン展開の場合、必要なアーティファクトをプリフェッチして内部に保存し、そのパスで Docling を指定します。
3. スピードを上げるか、より深く理解するかを選択できます
Docling は 1 つの解析方法に固定されていません。標準の PDF パイプラインは、レイアウトとテーブル用の特殊なステージを組み合わせています。 VLM パイプラインはページをエンドツーエンドで解釈できます。新しいネイティブ PDF パイプラインは、直接抽出で十分な場合に AI モデルをスキップします。これにより、ページごとに同じコンピューティング コストを支払うのではなく、単純なドキュメントと難しいドキュメントを異なる方法でルーティングすることが可能になります。
4. チャンク化により文書構造が理解される
の HybridChunker 階層的な文書要素から始まり、特大のチャンクを分割し、トークナイザーに従って互換性のある小さなチャンクをマージします。テーブルが複数のチャンクにまたがる場合、テーブル ヘッダーを繰り返すこともできます。これは、「500 文字ごとに分割する」よりも、読者がレポートを理解する方法にはるかに近くなります。
5. 既存の AI スタックに適合する
Docling には、LangChain、LlamaIndex、Haystack、CrewAI、ベクトル データベース、その他の AI ツールとの統合がリストされています。チームは Python から直接呼び出して実行できます。 ドッキングサーブ HTTP エンドポイントの背後で、分散バッチ ツールを使用するか、ドキュメント変換をエージェントに公開します。
Doclingのインストールと使用方法
現在のパッケージは Python 3.10 以降をサポートしています。最も簡単なインストールは次のとおりです。
pip install docling
次に、ローカル ファイルまたは URL を変換し、Markdown にエクスポートします。
from docling.document_converter import DocumentConverter
converter = DocumentConverter()
document = converter.convert("annual-report.pdf").document
markdown = document.export_to_markdown()
print(markdown)
同等のコマンドライン ワークフローも同様に直接的です。
docling annual-report.pdf
最初のテストにはこれで十分です。運用環境では、すべてのデフォルトに依存するのではなく、許可される形式、ページとファイルのサイズ制限、OCR 言語、コンピューティング リソース、タイムアウト、モデル ストレージを構成します。
RAG に対して Docling を使用する
よくある間違いは、Markdown をエクスポートし、すぐに文字数ごとに分割することです。これにより、Docling が回復に取り組んだ構造の一部が破棄されます。 RAG の場合は、ネイティブ チャンカーをテストすることから始めます。
from docling.chunking import HybridChunker
from docling.document_converter import DocumentConverter
document = DocumentConverter().convert("annual-report.pdf").document
chunker = HybridChunker()
texts_for_embedding = [
chunker.contextualize(chunk)
for chunk in chunker.chunk(dl_doc=document)
]
contextualize() 埋め込むテキストに見出しやキャプションなどの有用なメタデータを追加します。 Docling は、トークン制限が重要な場合、チャンカーのトークナイザーを埋め込みモデルに一致させることを推奨します。
そこからのフローはよく知られたものです。チャンク テキストを埋め込み、ベクトルとメタデータを保存し、関連するチャンクを取得し、必要に応じてチャンクを再ランク付けし、生成モデルに最良の証拠を提供します。より広範なアーキテクチャの説明については、ガイドを参照してください。 RAG および検索拡張生成 そして私たちの比較 RAG のベクトル データベース.
Markdown および複雑なテーブルに関する警告
Markdown は便利で読みやすく、広くサポートされています。ロスレスではありません。
Docling シリアル化ドキュメント では、結合されたテーブルのセルが JSON、DocLang、DocTags、および HTML に保存されることを説明しています。標準の Markdown テーブルには行スパンまたは列スパンの構文がないため、これらの関係はフラット化されます。
財務または科学のワークフローがマルチレベル ヘッダーに依存している場合、Markdown エクスポートがグラウンド トゥルースであると想定しないでください。 DoclingDocument またはロスレス JSON を保持し、テーブル構造が存続する必要がある HTML またはカスタム シリアライザーを使用します。
解析を改善すると実際に RAG が改善されるのでしょうか?
2026 年の 1 つの研究は、普遍的ではないが有用な証拠を提供しています。研究者らは、36 のポルトガルの行政文書を対象に、21 のパイプラインにわたって Docling、MinerU、Marker、DeepSeek OCR を比較しました。このコーパスでは、階層分割と画像記述を備えた Docling が最も強力な自動質問応答結果を達成し、94.1% ± 1.6% と報告されました。
より重要な結果は、より広範なものでした。 メタデータの強化と階層を意識したチャンキング コンバーター単独よりも精度に大きく貢献し、表に依存する質問は最大のギャップを生み出しました。この調査では、LLM の審査員による 1 つの言語とドメインで 50 の質問のみが使用されているため、ユニバーサル リーダーボードとして解釈すべきではありません。これは、アーキテクチャ上の教訓を補強するものです。つまり、解析とチャンク化の選択により、RAG システムが取得する答えが大幅に変わる可能性があります。
Docling 対 Unstructured 対 LlamaParse 対 Marker
これらのツールは重複していますが、同一の製品ではありません。最も有用な比較は、単一の精度スコアではなく、運用モデルとワークフローから始まります。
| ツール | 配信モデル | ベストフィット | 主なトレードオフ |
|---|---|---|---|
| Docling | オープンソース Python、CLI、セルフホスト API | 豊富な内部ドキュメントモデルによるローカルで構造を認識した取り込み | デプロイメント、チューニング、モデル成果物、スケーリングを自分で行うことができます |
| Unstructured | オープンソース ライブラリとマネージド ETL プラットフォーム | 幅広いソース/宛先コネクタと本番環境の取り込みワークフロー | プラットフォームの表面積が増加。ローカル機能とマネージド機能は個別に評価する必要がある |
| LlamaParse | ホスト型 LlamaCloud API | エージェント層とカスタム命令を使用した、難しいドキュメントの管理された解析 | 使用コスト、クラウドデータの境界、サービスの依存関係 |
| Marker | ローカルのオープンソース コンバータとマネージド Datalab オプション | PDF/ドキュメントを Markdown、JSON、HTML、またはチャンクに高速変換 | 品質とハードウェア モードは異なります。モデルウェイトライセンスの見直しが必要 |
| PyMuPDF4LLM | 軽量ローカルライブラリ | 重いビジョン パイプラインを必要としないドキュメントの高速かつ低セットアップの抽出 | AGPL/商用ライセンスとそれほど複雑ではないクロスフォーマットドキュメントモデル |
Docling 対 Unstructured
Unstructured また、ファイルをセマンティック要素に分割し、構造を認識したチャンク化を提供します。より大きな差別化要因は、周囲の ETL エコシステム (コネクタ、パイプライン、エンリッチメント、埋め込み、コンテンツをソースから宛先に移動するための管理された操作) です。
ローカルの Python 変換レイヤー、明示的なドキュメント モデル、カスタマイズ可能な解析パイプラインが問題の中心である場合は、Docling を選択します。多くのエンタープライズ リポジトリと宛先を継続的に同期することが各ファイルの解析と同じくらい重要な場合は、Unstructured を選択します。どちらもオープンソース コンポーネントを備えているため、実際のベイクオフをローカルで開始できます。
Docling 対 LlamaParse
LlamaParse は、ホスト型ドキュメント処理サービスである LlamaCloud の一部です。現在の API は、より困難な解析またはドメイン固有の解析のための自然言語命令を含む、高速でコスト効率の高いエージェント層とエージェント層プラス層を提供します。
この決定は主に運用上のものです。 LlamaParse は、モデルを自分で実行せずに、マネージド エンドポイント、弾力的な容量、高度な解析が必要な場合に魅力的です。 Docling は、ローカル制御、エアギャップ使用、予測可能なインフラストラクチャ所有権、検査可能なオープンソース パイプラインがより重要な場合に魅力的です。文書が環境を離れることができない場合、正確性よりもその区別が評価を決定する可能性があります。
Docling 対 Marker
Marker これも強力なローカル ドキュメント コンバータです。 Markdown、JSON、HTML、チャンクを生成でき、現在のパイプラインはスキャン、方程式、および信頼性の低い構造に対してビジョン処理を選択的に使用します。 PDF 変換の品質とローカルでの実行が主な要件である場合、これは自然な候補になります。
Docling は、より広範な DoclingDocument エコシステム、来歴、ネイティブ チャンキング、構成可能なパイプライン、統合サーフェスを特徴としています。 Marker のコードは Apache 2.0 ですが、現在のモデルの重みには商用しきい値が設定された OpenRAIL ベースのライセンスが別途必要です。 Docling のコアは MIT ライセンスを取得していますが、オプションのモデル ライセンスを確認する必要があります。どちらのライセンス概要も、商用展開のための法的レビューに代わるものではありません。
Docling 対 PyMuPDF4LLM
PyMuPDF4LLM 意図的に軽量化されています。高速な MuPDF エンジンを使用し、コア ワークフローに GPU を必要とせず、Markdown、JSON、テキスト、およびページ チャンクを出力できます。クリーンな PDF のコレクションの場合、少ない機械で必要なものを正確に提供できる可能性があります。
Docling は、より豊富なクロスフォーマット構造、特殊なレイアウトおよびテーブル モデル、切り替え可能な OCR/VLM パイプライン、または多くのドキュメント タイプにわたる共通の表現が必要な場合に、より合理的です。 PyMuPDF4LLM は、AGPL と商用ライセンスに基づいて二重ライセンスが付与されており、独自の展開にも影響を与える可能性があります。
Docling が苦戦できる場所
Docling は機能しますが、ドキュメントの解析の問題が解決されるわけではありません。
- 複雑なページにはまだテストが必要です。 ネストされたテーブル、異常なフォーム、手書き、密集した図、低品質のスキャン、壊れたテキスト レイヤーは、パーサーを混乱させる可能性があります。
- デフォルトのインストールは小さくありません。 Docling は Python と PyTorch に依存しており、よりリッチな PDF パイプラインにはモデルの重みが必要です。初回実行のダウンロードとコールド スタートを計画する必要があります。
- 大規模な場合、CPU 処理が遅くなる可能性があります。 地元だからといって自動的に安いというわけではありません。実際のハードウェアで 1 秒あたりのページ数、メモリ、キュー時間、同時実行性を測定します。
- オプションの形式では依存関係が追加されます。 Office の従来のファイル、ビデオ、オーディオ、Apple Pages には追加のコンポーネントが必要です。
- 出力の選択により構造が削除される可能性があります。 便利な Markdown エクスポートは、内部モデルが保持していた情報を平坦化することができます。
- プロジェクトは迅速に進みます。 新しいリリースが頻繁に到着します。アップグレードする前に、バージョンを固定し、代表的なドキュメント セットを回帰テストします。
- それは取り込み層のみです。 埋め込み、保存、取得、アクセス制御、評価、および回答生成戦略が依然として必要です。
公式ロードマップでは現在、タイトル、著者、参考文献、言語などの自動メタデータ抽出が近日中に提供される予定となっています。これらのフィールドが現在不可欠である場合は、それらが完了していると仮定するのではなく、独自の抽出および検証ステップを追加してください。
Docling を選択するのはどのような場合ですか?
Docling は次の場合に重大な裁判を受けるに値します。
- ドキュメントはインフラストラクチャ内に保管する必要があります。
- 表、ページ レイアウト、階層、または引用は検索に重要です。
- PDF、Office ファイル、Web コンテンツ、画像、電子メール、または専門的な形式にわたって 1 つの取り込みモデルが必要です。
- あなたのチームは Python サービスまたはバッチ パイプラインの操作に慣れています。
- Markdown だけではなく、豊富なドキュメント表現を保持したい場合。
- ネイティブ、標準、OCR、および VLM 処理を自由に切り替える必要があります。
エンジニアリング チームが小規模である場合、予測できない急増がある場合、または解析インフラストラクチャを運用したくない場合には、マネージド サービスがより良い選択となる可能性があります。ほぼすべてのソースがクリーンなデジタル化された PDF である場合、軽量のライブラリが勝つ可能性があります。最良のパーサーは、アプリケーションが依存する情報を保存する最も複雑でないシステムです。
独自のドキュメントで Docling を評価する方法
- 難しいテストセットを作成します。 複数列のページ、スキャン、回転されたページ、長い表、結合されたセル、グラフ、脚注、およびすべての重要な言語が含まれます。
- 「正しい」とはどういう意味かを定義します。 文字の正確さだけでなく、読み上げ順序、表のセル、見出し、キャプション、ページ参照、省略も採点します。
- パイプラインを比較します。 追加の理解が役立つ場合にのみ、ネイティブ抽出、標準 PDF パイプライン、OCR 設定、および VLM をテストします。
- エンドツーエンドで取得をテストします。 レイアウトやテーブルによって答えが異なる質問をしてください。最終的な文章を判断する前に、取得した証拠を確認してください。
- オペレーションを測定します。 レイテンシ、スループット、メモリ、モデルのダウンロード サイズ、失敗、再試行や人によるレビューのコストを記録します。
- 黄金のコーパスを保管してください。 パーサー、モデル、チャンカー、またはバージョンが変更されるたびに、同じドキュメントと質問を再実行します。
デモ ドキュメントやベンダーのリーダーボードからパーサーを選択しないでください。調達アーカイブ、科学ライブラリ、請求書のワークフローは、3 つの異なる勝者を生み出す可能性があります。
よくある質問
Docling は IBM 製品ですか?
Docling は、IBM Research の AI for Knowledge チームから始まりました。これは現在、LF AI & Data Foundation が主催するオープンソース プロジェクトであり、IBM は依然としてその開発と研究に密接に関わっています。
Docling は無料でオープンソースですか?
はい。 Docling のコア コードは MIT ライセンスの下で利用可能です。オプションのモデルとサードパーティのコンポーネントには独自の条件が適用される場合があるため、デプロイメントで使用される正確なアーティファクトを確認してください。
Docling はローカルで実行されますか?
はい。ローカル実行はコア機能であり、モデル アーティファクトをオフラインまたはエアギャップ環境用にプリフェッチできます。コンテンツをリモート モデル サービスに送信するには、明示的なオプトインが必要です。
Docling には GPU が必要ですか?
いいえ、基本的な用途ではありません。 Docling は CPU 実行をサポートしており、その新しいネイティブ PDF パイプラインはレイアウト、OCR、またはテーブル モデルを実行しません。 GPU を使用すると、特にボリュームの要求が高い AI ベースのパイプラインのスループットを向上させることができます。
Docling は RAG に適していますか?
はい、特に検索が文書構造に依存する場合は可能です。その統一されたドキュメント モデル、来歴、階層を認識したチャンカー、およびフレームワークの統合は、AI の取り込み用に設計されています。ファイルを使用してそれを評価し、残りの取得スタックを構築する必要があります。
Docling と OCR の違いは何ですか?
OCR は、画像またはスキャン内のテキストを認識します。 Docling は OCR を使用できますが、読み取り順序、レイアウト、テーブル、階層、画像、要素間の関係も理解しようとします。 OCR は、より広範なドキュメント理解ワークフロー内の 1 段階です。
Docling は LlamaParse または Unstructured よりも優れていますか?
すべての状況でというわけではありません。 Docling は、ローカル制御と豊富な構造化表現にとって特に魅力的です。 LlamaParse はマネージド エージェント解析サービスを重視するのに対し、Unstructured は解析をより広範な ETL およびコネクタ プラットフォームと組み合わせます。同じドキュメント、下流の質問、および運用上の制約に対してツールをテストします。
情報源と方法論
この記事は、 Docling の公式ドキュメント, ソースリポジトリ, IBMリサーチ技術レポート、そして v2.126.0 リリースノート。比較には公式ドキュメントまたはリポジトリを使用します。 Unstructured, LlamaParse, Marker、そして PyMuPDF4LLM。製品の機能とライセンスは変更される可能性があります。導入前に現在のドキュメントを確認してください。
結論
Docling は、文書構造を保持する価値のあるデータとして扱うため、興味深いものです。多くのファイル タイプを共通の追跡可能な表現に変換し、ローカルで実行し、その後のチャンク化と取得の段階でマテリアルを手作業でクリーンアップすることができます。
その強みには責任が伴います。パイプラインを操作し、適切な処理モードを選択し、適切な出力を保存し、あらゆる困難なドキュメント クラスをテストします。プライベートまたは構造重視の RAG を構築しているチームの場合、多くの場合、その制御がポイントとなります。マネージド API の背後で解析を消去したいチームには、別のツールの方が適している可能性があります。
実際のレッスンはツール環境よりも単純です。言語モデルを変更する前に、パーサーがそれに何を与えたかを調べてください。より優れた AI の回答は、多くの場合、より優れた文書から始まります。


