• AI ナレッジベース
  • 人工知能

RAG のデータベースをベクトル化するにはどれくらいの費用がかかりますか?

埋め込みや解析からベクトル ストレージ、クエリ、レプリカ、インデックスの再作成に至るまで、RAG のデータベースをベクトル化するのに実際にかかるコストを学びます。

によって オリオール・ゼルトゥーシュ読書時間: 5
ビジネス文書は幾何学的な埋め込みベクトルと組織化された RAG 検索インデックスに変換されます。

検索拡張生成 (RAG) 用にデータベースをベクトル化するには、小規模な知識ベースの場合は数セント、頻繁に変更される大規模なコーパスの場合は数千ドルの費用がかかる可能性があります。驚くべきことに、API の埋め込みは、多くの場合、最も小さな費用の 1 つであるということです。ドキュメントの解析、ベクター データベースの容量、クエリ トラフィック、レプリカ、再ランキング、評価、およびインデックスの再作成には、ベクターの生成よりもコストがかかる場合があります。

30 秒での答えは次のとおりです。 2026 年 9 月 2 日に見直されたオンラインの公開定価では、1 億個のテキスト トークンを埋め込むのにかかる費用はおよそ 2ドルから20ドル 以下に主流モデルを比較します。私たちの実際の例では、500 ワードの 100 万ページをベクトル化するには約 OpenAI text-embedding-3-small の場合は 15 ドル、text-embedding-3-large の場合は 96 ドル、Gemini Embedding の場合は 111 ドル。すべてのページに 1,000 ページあたり 1.50 ドルの Cohere Parse も必要な場合、解析により追加される $1,500。ストレージ、インデックス、クエリ、書き込み、レプリカ、バックアップ、エンジニアリングは別個のものです。

このガイドでは、これらの数値の背後にある計算式を示し、埋め込みデータベースとベクター データベースの価格を比較し、Pinecone、Google Agent Retrieval、SingleStore、Supabase、Qdrant、Weaviate、Zilliz、Chroma、Elasticsearch、MongoDB、および pgvector がどこに当てはまるかを説明します。価格は変化するため、すべてのベンダーの数値を日付のある計画入力として扱い、使用する予定の地域と計画を確認してください。

「データベースのベクトル化」には実際には何が含まれるのでしょうか?

ベクトル化は、埋め込みモデルを呼び出すための短縮形として一般に使用されます。動作する RAG インデックスにはさらに多くの手順があります。完全な取得パイプラインを初めて使用する場合は、まず、 RAG API と検索拡張生成の説明.

  1. 抽出して解析します。 ファイルまたはアプリケーション レコードからテキスト、表、画像、レイアウト、およびメタデータを読み取ります。
  2. クリーンとチャンク: ノイズを除去し、有用な構造を保持し、コンテンツを取得可能なパッセージに分割し、コンテキストが壊れてしまう場合はチャンクをオーバーラップします。
  3. 埋め込みを生成します。 各チャンクを埋め込みモデルに送信するか、独自のインフラストラクチャでモデルを実行します。
  4. 書き込みとインデックス付け: ベクトル、テキスト、ソース識別子、タイムスタンプ、テナント ID、および許可メタデータを保存します。次に、検索インデックスを構築または更新します。
  5. 検索を提供: クエリを埋め込み、高密度またはハイブリッド検索を実行し、結果をフィルタリングし、オプションで候補を再ランク付けします。
  6. ライフサイクルを操作します。 変更の同期、取り消されたコンテンツの削除、データのバックアップ、品質の監視、モデルまたはチャンキング戦略が変更された場合の再埋め込みを行います。

埋め込みトークンのみをカバーする見積もりは、「最初の API 呼び出しの費用はいくらですか?」という 1 つの狭い質問に答えます。有用な予算とは、「予想されるレイテンシとトラフィックで、関連性があり、パーミッションセーフなコンテキストを利用可能な状態に保つのにどれくらいの費用がかかるか?」に答える必要があります。

RAG ベクトル インデックスのコスト計算式

ソース トークン、チャンク サイズ、チャンクのオーバーラップ、ベクトル次元、次元あたりのバイト数の 5 つの入力を使用して初期ビルドを推定できます。しましょう T ソーストークンである、 C チャンクサイズ、および 重なり合う:

  • 埋め込みトークン ≈ T × C ÷ (C − O)
  • チャンク数 ≈ T ÷ (C − O)
  • API の埋め込みコスト = 埋め込みトークン ÷ 1,000,000 × 100 万トークンあたりのモデル価格
  • 生のベクトルのバイト数 = チャンク × ディメンション × ディメンションあたりのバイト数 × レプリカ
  • クエリ埋め込みコスト = クエリ数 × 平均クエリトークン ÷ 1,000,000 × モデル価格

繰り返されるテキストが繰り返し埋め込まれるため、重複が重要になります。 50 トークンのオーバーラップがある 500 トークン チャンクでは、オーバーラップがない場合と比較して、トークンの請求額が約 11.1% 追加されます。生のベクトル バイトは、データベース容量の見積もりではありません。メタデータ、保存されたテキスト、近似最近傍インデックス、先行書き込みログ、レプリカ、バックアップ、一時的な圧縮スペース、および運用上のヘッドルームはすべて、データベース容量の見積もりに追加されます。

ソース メジャーがトークンではなくページである場合、実際の計画変換は次のようになります。

ソーストークン ≈ ページ × ページあたりの平均単語 × 単語あたりのトークン。

英語のビジネス テキストは、多くの場合、概算として 1 単語あたり約 1.3 トークンでモデル化されます。表、OCR エラー、コード、識別子、または複数の言語を含む PDF は大幅に異なる場合があります。多額の予算を承認する前に、実際のコーパスからサンプルを測定します。

埋め込みコストの比較: 1 億トークンのコストはいくらですか?

この表では、2026 年 9 月 2 日に公開されているオンライン テキスト入力価格を使用しています。この表では、無料割り当て、交渉による契約、再試行トラフィック、チャンクの重複、および将来の再埋め込みを意図的に除外しています。プロバイダーがサポートしている場合は、バッチ料金が安くなることがあります。

埋め込みモデルオンライン入力価格1億トークンのコスト重要な価格設定の詳細
OpenAI テキスト埋め込み-3-small$0.02 / 100万トークン$2デフォルトでは 1,536 次元。寸法を縮小することができます。
ボヤージュ 4 ライト$0.02 / 100万トークン$2Voyage は、無料トークンの割り当てと Batch API の割引を公開しています。資格が重要です。
航海4$0.06 / 100万トークン$6柔軟な出力サイズと量子化をサポートします。
航海4大$0.12 / 100万トークン$12上位モデルの価格は、解析と提供を除けばまだ軽微である可能性があります。
OpenAI テキスト埋め込み-3-大$0.13 / 100万トークン$13デフォルトでは 3,072 次元。ベクトルが大きくなると、データベースの容量が増加する可能性があります。
Gemini Embedding$0.15 / 100万トークン$15Google はバッチ入力に 100 万あたり 0.12 ドルをリストしています。
Gemini Embedding 2 プレビュー、テキスト$0.20 / 100万トークン$20Google はバッチ テキストに 100 万あたり 0.10 ドルをリストしています。画像、ビデオ、オーディオでは異なる単位とレートが使用されます。
1 億テキスト トークンのパブリック埋め込み API コストを比較した棒グラフ。OpenAI text-embedding-3-small および Voyage 4 Lite の 2 ドルから、Gemini Embedding 2 プレビューの 20 ドルまでです。
1 億テキスト トークンの公開オンライン定価比較。2026 年 9 月 2 日に確認。無料枠、バッチ割引、重複、再試行、再埋め込みは除外されます。

Google のマルチモーダル プレビュー価格の背後にある機能と制限については、 Gemini Embedding 2 ガイド.

トークンの最低価格が必ずしも総コストの最低であるとは限りません。必要な次元が少ないモデルでは、ストレージとメモリを削減できます。より適切に取得するモデルは、再ランキングや生成の無駄を減らすことができます。逆に、高価なモデルは、ドメインを改善せずに、より大きなベクトルを生成する可能性があります。公開ベンチマークに数十億のチャンクを掛ける前に、ラベル付き検索セットでモデルを比較します。

動作例: 10,000 ページから 1,000 万ページまで

計算を再現可能にするために、次のシナリオでは、ページあたり 500 ワード、ワードあたり 1.33 トークン、500 トークン チャンク、50 トークンのオーバーラップ、1,536 次元の float32 ベクトル、および各ベクトルのコピー 1 つを前提としています。これらには、解析、メタデータ、インデックス、レプリカ、バックアップ、読み取り、書き込み、および労力は含まれません。

コーパスソーストークン埋め込みトークン約チャンク生のベクターOpenAI 小OpenAI 大
10,000ページ6.65M739万14,7780.08 GiB$0.15$0.96
100,000ページ66.5M7390万147,7780.85 GiB$1.48$9.61
100万ページ665M738.9M148万8.46 GiB$14.78$96.06
1,000万ページ6.65B7.39B1478万84.56 GiB$147.78$960.56

100 万ページの行の場合、100 万入力トークンあたり 0.15 ドルの Gemini Embedding のコストは約 110.83 ドルになります。これらの数字は、「埋め込みは高価である」ということがテキストに対する誤った仮定である可能性がある理由を示しています。同じスケールで、 Cohere Parse には、1,000 ページあたり 1.50 ドル、または 100 万ページすべてが解析された場合は 1,500 ドルの API 料金がリストされています。特に表、フォーム、スライド、複雑な PDF の場合、解析を改善することは価値がありますが、独自の項目としてモデル化する必要があります。私たちの Cohere Parse v5 ガイド このトレードオフについて詳しく説明します。

100 万ページがどのようにして 7 億 3,890 万の埋め込みトークン、約 148 万のチャンク、8.46 GiB の生ベクトル、および個別の解析、埋め込み、およびデータベースのコスト レイヤーになるかを示すインフォグラフィック
100 万ページにわたる透明な例。データベース層と運用層は追加的なものであり、選択したプロバイダー、インデックス、トラフィック、レプリケーション、およびサービス レベルに依存します。

どれくらいのベクター ストレージが必要ですか?

密な float32 ベクトルの場合、各次元は 4 バイトを使用します。したがって、1,536 次元のベクトルには、インデックスまたはメタデータの前に 6,144 の生バイト (約 6 KB) が必要です。この例の 148 万個のチャンクにより、約 8.46 GiB の生のベクターが生成されます。

Qdrant の容量計画ガイダンス は同じ基本式を使用し、HNSW リンク、ペイロード、ペイロード インデックス、レプリケーション、ヘッドルームを個別に推定します。これらの追加は、ベクトルと次元の乗算が法案ではなく下限である理由を説明しています。近似検索インデックスは大量のメモリを占有する可能性があります。保存されたチャンク テキストとリッチ メタデータは圧縮ベクトルを上回る可能性があります。レプリカはデータを増殖します。また、移行には一度に 2 つの完全なインデックスが必要になる場合があります。

精度は最大の手段の 1 つです。 Float16 は、生のベクター バイトをおよそ半分にカットします。 8 ビットのスカラー量子化では、それらをおよそ 4 倍に削減できます。バイナリおよび積量子化技術はさらに進化することができます。 量子化ガイダンス また、圧縮はリソースの節約のために精度を犠牲にするという重要な注意点も明確にしています。圧縮率を無料のお金として扱う前に、独自のコーパスで再現率とランキングの品質を測定します。

RAG のベクター データベースのコスト比較

ベクター データベースの価格は、最小プランのコミットメント、コンピューティング時間、ディメンション、読み取りまたは書き込みユニット、保存された GiB、vCU、転送されるデータ、またはそれらの組み合わせなど、ベンダーがさまざまなものを測定するため、組み込みの価格よりも比較するのが困難です。次の表は計画マップであり、正規化されたベンチマークではありません。

プロバイダー公開価格の形状ベクトル化の仕組み最適なコストフィット/注意事項
Pineconeスターター無料。ビルダーは月額 20 ドル。 Standard の最低料金は月額 50 ドルです。 Enterprise の最低料金は月額 500 ドルです。サーバーレスを使用すると、ストレージ、読み取り、書き込み、インポート、その他の機能が追加されます。現在の AWS us-east-1 の例では、ストレージが 1 GB あたり 0.33 ドル、読み取りユニット 100 万あたり 16 ドルとなっており、書き込み料金はプランによって異なります。ベクトルを導入するか、統合された埋め込みおよび再ランキングのワークフローを使用します。モデル料金と制限を含める必要があります。操作量が少なく、柔軟な使用法。読み取りユニットはクエリの対象となるデータに依存するため、名前空間の設計はコストに影響します。
Google エージェントの取得使用量ベースのストレージ、読み取り、書き込み、データ取り込み、容量単位。公開料金には、保存あたり約 0.000410959 ドル/GiB 時間、読み取り 100,000 回あたり 0.06 ドル、書き込み 100,000 回あたり 0.18 ドルが含まれます。パフォーマンスとストレージ容量の単位は分離されています。自動埋め込み、ハイブリッド検索、セマンティック再ランキングをサポートします。 Google は、選択した Gemini 埋め込みモデルは個別に請求されると述べています。Google Cloud ネイティブのパイプラインにとっては魅力的ですが、「自動」だからといって埋め込みが無料というわけではありません。
シングルストア ヘリオス無料の共有枠。標準 S-00 は 1 時間あたり 0.99 ドルから始まり、月 730 時間の場合は約 723 ドルとストレージが含まれます。マルチ AZ およびエンタープライズ乗数によりコンピューティングが向上します。ベクトルをリレーショナル データと一緒に保存し、ベクトル検索をサポートします。 AI 関数は SQL からモデルを呼び出すことができます。プレビューのステータスを確認し、モデルまたは推論の料金を個別に確認します。トランザクション、分析、ベクトルのワークロードが一緒に属する場合に強力です。常時稼働のコンピューティング フロアは、小規模なベクターのみのプロジェクトでは高くなります。
Supabase + pgvector無料には 500 MB のデータベースが含まれます。 Pro は月額 25 ドルで、10 ドルのコンピューティング クレジットが含まれます。データベース ディスクには 8 GB が含まれており、$0.125/GB と表示されます。マイクロから上のスケールを計算します。pgvector はベクトルを保存および検索します。 Supabase は、ローカル モデルや外部 API を含む、エッジ機能と自動埋め込みパターンを文書化します。外部埋め込みの使用は別です。アプリがすでに Postgres、認証、行レベルのセキュリティを使用している場合に最適です。通常、スケールは、特別な「ベクトル料金」ではなく、インデックス メモリとデータベースのコンピューティングによって決まります。
Qdrant クラウド1 GB RAM と 4 GB ディスクを備えた無料クラスター。有料クラスターでは、CPU、メモリ、ディスク、バックアップ、およびオプションの推論が時間ごとに測定されます。ベクトルを使用するか、可能な場合は Qdrant クラウド推論を使用します。透過的なリソースサイジングとオープンソースのセルフホストパス。本番環境のセルフホスト型クラスターでは、クラウド料金がインフラストラクチャとオペレーターの時間に反映されます。
Weaviate クラウド無料のサンドボックス。フレックスは月額 45 ドルから始まります。プレミアムは月額 400 ドルから始まります。 Flex には、ベクトル次元、ストレージ、およびバックアップのメーターがリストされます。ベクトルを持ち込むか、統合されたベクトル化モジュールを使用します。ホストされたモデルのトークン料金は別個に設定できます。ハイブリッド検索と統合モデルによりアプリケーションの作業が軽減される場合に役立ちます。ディメンションベースの価格設定により、チャンク数とベクター サイズが特に明確になります。
ジリズクラウド / Milvusサーバーレスでは、vCU とストレージの 100 万個あたり 4 ドルをリストしています。ベンダーの例では、他のサービスに先立って、100 万の 1,536 次元ベクトルを書き込むのに約 6 ドル、100 万のベクトル コレクションに対する 100 万回の検索に約 100 ドルかかると見積もっています。通常、埋め込みは外部モデルまたはアプリケーション管理モデルから取得されます。Milvus 互換パスを持つサーバーレス エントリ。検索コストは、コレクションのサイズ、ベクトルの次元、上位 K、フィルター、ワークロードによって変化します。
クロマクラウドスターターはクレジットによる使用量ベースです。パブリック メーター リストでは、書き込み $2.50/GiB、保存 $0.33/GiB-月、クエリ $0.0075/TiB、返される $0.09。チーム料金は月額 250 ドルで、さらにクレジットによる使用料がかかります。アプリケーションで生成されたベクターと組み込み統合を操作できます。シンプルなメータリングと迅速な開発。返されるデータとクエリ量の仮定は大規模な場合に重要です。
エラスティッククラウドサーバーレス検索、取り込み、機械学習 VCU、ストレージ、送信は個別に測定されます。ベクトル プロファイルには許容値が含まれており、推論はトークンごとのレートで開始されます。Elastic は、密ベクトルと疎ベクトルに加えて、推論エンドポイントとハイブリッド検索をサポートします。語彙検索、フィルタ、可観測性がより広範なプラットフォームを正当化する場合に適しています。保存された GB だけでなく、取り込み容量と検索容量もカウントします。
MongoDB アトラス ベクトル検索Atlas クラスターのコストに検索ノードまたは共有リソースを加えたもの。 S20 検索ノードは、AWS で 1 時間あたり 0.12 ドルから公開されています。専用検索の展開には少なくとも 2 つのノードが必要であり、データベース クラスターの前に検索ノードの最低価格は月額約 175 ドルになります。埋め込みをドキュメントの横に保存します。アプリケーションまたはモデルの統合によって生成されます。Atlas がすでに JSON データを所有している場合に経済的なアーキテクチャに適合します。ベクターのみのプロジェクトでもデータベース層の料金を支払う必要があります。
セルフホスト型 pgvector別途 pgvector ライセンス料はかかりません。 Postgres コンピューティング、メモリ、ディスク、レプリカ、バックアップ、ネットワーク、および運用の料金を支払います。管理対象 Postgres プロバイダーは独自のメーターを追加します。アプリケーション、データベース関数、または接続されたサービスに埋め込みを生成します。多くの場合、既存の Postgres チームにとって最も複雑さの低い選択肢です。 「オープンソース」は総コストがゼロということではありません。

2026 年 9 月 2 日に確認された価格スナップショット。料金はクラウド、リージョン、プラン、予約、サポート レベル、および交渉による合意によって異なる場合があります。購入する前に、リンクされた各価格ページに従い、独自のクエリ パターンをモデル化してください。

質的な取得と展開の違いについては、このガイドと最新の比較を併用してください。 RAG のトップ ベクター データベース.

Pinecone、Google、SingleStore、および Supabase: コスト モデルの違い

Pinecone: 使用量メーターとプランの最小値

Pinecone サーバーレスは、ストレージ、書き込み、読み取りを分離します。それ コストの文書化 では、クエリ読み取りユニットが検索の対象となる名前空間のサイズに応じて拡張され、クエリごとの最小料金が設定されると説明しています。そのため、マルチテナント データの設計は財務上の決定になります。テナントごとに 1 つの名前空間を使用すると、各検索の範囲をより少ないデータに保つことができますが、共有名前空間では、メタデータ フィルターが小さい結果セットを返す場合でも、クエリがより大きなコレクションにアクセスする可能性があります。

計画の際は、月額プランの最小額と従量制データの運用を分けてください。次に、現実的な名前空間のサイズ、top-k、再ランキング、バッチ更新/挿入、およびトラフィックをテストします。低い未加工ストレージ料金と、クエリ量が多い場合のより大きな読み取り料金を共存させることができます。

Google Agent Retrieval: 自動ベクトル化、別途請求

以前は Vector Search 2.0 として導入されていた Google Agent Retrieval は、埋め込みを自動的に作成し、ハイブリッド検索とセマンティック再ランキングを追加できます。経済性ではなく、利便性によりパイプライン コードが削除されます。 Googleの概要 自動埋め込みには Gemini API が使用されると記載されており、価格ページには、選択した埋め込みモデルが個別に請求されると記載されています。

したがって、Google の見積もりには、Gemini 埋め込みトークン、データの取り込みまたは書き込み、保存された GiB と容量ユニット、読み取り操作の少なくとも 4 つのレイヤーが含まれる必要があります。この新しい使用量ベースのサービスと標準の Vertex AI Vector Search を慎重に比較してください。古い製品には、異なるインデックス構築、ストリーミング更新、およびサービングノードメーターがあります。

SingleStore: 常時接続データ プラットフォーム内のベクトル検索

SingleStore は、ベクトル、リレーショナル レコード、フルテキスト フィールド、および分析を 1 つの分散 SQL システムに保持できます。この統合により、同期ジョブと個別のインフラストラクチャが削除されます。トレードオフは、エントリーで支払われるコンピューティング サイズは、数ドルのサーバーレス ベクター ストレージではなく、常時稼働のデータベース ワークスペースであることです。

結合されたワークロードによってコンピューティングが行われる場合は、SingleStore を使用します。運用データ、分析、全文検索、ベクトル検索が 1 つのプラットフォームを共有できます。小規模なドキュメント インデックスのみが必要な場合は、月額約 723 ドルの S-00 コンピューティング フロアをサーバーレスまたは既存の Postgres オプションと比較してください。 AI 関数が SQL から埋め込みモデルを呼び出す場合は、どの関数が一般的に利用可能で、誰が推論に請求するのかを確認してください。

Supabase: pgvector が含まれます。埋め込み生成は別の選択です

Supabase は、pgvector 拡張機能を備えた Postgres を提供するため、ベクトルごとに個別のデータベース製品を購入する必要はありません。請求書は、Supabase プラン、データベース コンピューティング、ディスク、エグレス、および呼び出した埋め込みサービスによって決まります。 Pro プロジェクトの 25 ドルの基本料金にはコンピューティング クレジットが含まれていますが、より大きなインデックスやより重いクエリには、より多くのメモリとより大きなコンピューティング サイズが必要になる場合があります。

Supabase も公開しています 自動埋め込みパターン トリガー、キュー、エッジ関数、埋め込みプロバイダーを使用します。そのエッジ関数は特定の組み込みモデルを実行できますが、他の例では OpenAI を呼び出します。どちらの場合も、「自動」はオーケストレーションを表します。実際のコストは、エッジ機能の使用量、データベース リソース、および外部モデルの請求額に影響します。

マネージド型とセルフホスト型: どちらが安いですか?

アプローチコストメリット人々が見逃しているコスト通常、最適な場合
マネージドサーバーレスアイドル容量が少なく、迅速なセットアップ、自動スケーリング、バックアップとアップグレードが含まれているか、利用可能です。最小値、読み取り/書き込みユニット、出力、サポート層、プレミアム リージョンを計画し、インデックス レベルのチューニングの制御を制限します。トラフィックが不確実であるか、チームにデータベース操作能力がほとんどありません。
マネージド専用予測可能なキャパシティとサポート。プライベート ネットワーキングとサービス レベルの目標が容易になります。アイドル状態のノード、レプリカ、最小クラスター サイズ、オーバープロビジョニング、サポート コミットメント。トラフィックが持続的で予測可能であるか、コンプライアンスに準拠するための専用のフットプリントが必要です。
ベクトルを含む既存のデータベースデータ、権限、バックアップ、スキル、ベンダー契約を再利用します。同期パスが少なくなります。ベクター インデックスはトランザクション ワークロードと競合します。メモリのアップグレードとリードレプリカには費用がかかる場合があります。Postgres、Elasticsearch、MongoDB、または SingleStore はすでに信頼できる情報源を所有しています。
自己ホスト型のスペシャリスト エンジンマネージドサービスのマージンはありません。最大の配置とチューニング制御。オープンソースの移植性。エンジニアリング、オンコール、アップグレード、セキュリティ、モニタリング、容量、バックアップ、復元テスト、ダウンタイムのリスク。規模が大きく安定しているか、運用チームによる展開制御が確実な要件である。

セルフホスティングのコストが安くなるのは、インフラストラクチャと労力の節約が、引き受ける作業を上回った場合に限られます。 2 ノードまたは 3 ノードの実稼働クラスター、バックアップ、監視、プライベート ネットワーキング、インシデント対応、エンジニアの時間により、少額の管理請求額を圧倒する可能性があります。非常に大きな安定したワークロードでは、適切に実行されたセルフホスティングが経済的になる可能性がありますが、そのクロスオーバーは、十分な労力と信頼性の要件を考慮して計算する必要があります。

プロトタイプからエンタープライズ規模までコストはどのように変化するか

プロトタイプ: 容量を購入する前に検索品質を証明する

数万ページのプロトタイプは、多くの場合、無料枠または既存の小規模な Postgres インスタンスに収まります。埋め込みコストは 1 ドルをはるかに下回る可能性があります。限られた予算を、代表的な文書サンプル、難しい質問、許可テスト、評価に費やします。小さなデモのレイテンシに基づいてアーキテクチャを決定することは避けてください。

本番環境: トラフィックと信頼性が主な変数として埋め込みに取って代わります

数十万から数百万ページの場合でも、生のベクターは数十 GiB に収まる可能性がありますが、p95 レイテンシ、同時ユーザー、フィルタリング、取り込みの鮮度、および高可用性がサイジングを左右します。クエリ読み取りユニット、データベース メモリ、2 つ以上のレプリカ、バックアップ、および 1 回の完全なインデックスのモデル化。単なるクエリあたりのコストではなく、成功した根拠のある回答あたりのコストを計測します。

エンタープライズ: ガバナンスとライフサイクルが支配的

数千万ページまたは厳格なコンプライアンス境界では、コーパスのセグメント化、テナントの分離、プライベート ネットワーキング、地域コピー、復元目標、削除証明、監査ログ、評価スイート、および移行容量がすべて重要になります。交渉による合意により、公開価格の関連性が薄れる可能性がありますが、ワークロードベースのユニットエコノミクスの必要性がなくなるわけではありません。

ベクトル化予算に含まれる 8 つの隠れたコスト

  1. 解析と OCR: 複雑な PDF、スキャン、表、画像を多く含むドキュメントには、有料のパーサーまたはビジョン モデルが必要になる場合があります。
  2. チャンクの重複と重複: 繰り返されるテキスト、ボイラープレート、バージョン、コピーは、知識を増やすことなくトークンとベクトルを膨張させます。
  3. メタデータとソーステキスト: 6 KB ベクトルのペイロードは、そのベクトルよりも大きくなる可能性があります。
  4. インデックスメモリとビルド時間: HNSW グラフ、ペイロード インデックス、圧縮、および再構築には、作業スペースとコンピューティングが必要です。
  5. クエリ、再ランキング、および生成: 短いクエリの埋め込みは低コストです。大規模なコレクションを検索し、数十の候補を再ランク付けし、長い回答を生成すると、繰り返し請求が発生する可能性があります。
  6. レプリケーションとリカバリ: 2 つのレプリカではベクトル データの保存量が約 2 倍になりますが、バックアップとリージョン間のコピーではさらに多くのデータが追加されます。
  7. 変更データのキャプチャと削除: コネクタ、キュー、再試行、トゥームストーン、および権限の同期には、インフラストラクチャとエンジニアリングの両方が必要です。
  8. 再埋め込みと移行: 新しいモデルまたはチャンカーでは、バックフィル中に 2 番目の完全なインデックスが必要になる可能性があり、ストレージと書き込みのコストが一時的に増加します。

クエリの埋め込みは通常、単独では簡単です。 20 トークンの質問 100 万件は 2,000 万の入力トークンに相当します。上記のレートで、OpenAI text-embedding-3-small の場合は約 0.40 ドル、text-embedding-3-large の場合は 2.60 ドル、または Gemini Embedding の場合は 3 ドルです。データベースの読み取り、再ランキング、および回答の生成は、より大きな経常コストとなる可能性があります。

RAG の品質を損なうことなくベクトル化コストを削減する方法

  1. 埋め込む前に重複を削除します。 正規化されたチャンクをハッシュし、同一のボイラープレートまたはファイル バージョンのインデックス作成を回避します。
  2. 評価付きのチャンク化を選択します。 チャンクが大きくなるとベクトル数が減りますが、検索が遅くなる可能性があります。過剰なオーバーラップはトークンを繰り返します。実際の質問に対して両方を調整してください。
  3. 最小の有効な埋め込みモデルを使用します。 モデルのサイズだけではなく、Recall@k、nDCG、ダウンストリームの応答精度、レイテンシ、寸法、価格を比較します。
  4. 意図的に寸法を小さくします。 OpenAI と Voyage は柔軟な寸法を文書化します。ベクトルが小さいほど、ストレージとメモリが節約されます。まず品質を検証します。
  5. ベースラインを確立した後に量子化します。 Float16 または 8 ビット ベクトルはメモリを削減できますが、その前後でリコールを測定します。
  6. オフラインジョブをバッチ処理します。 Google と Voyage は割引バッチ パスを公開しています。サービス制限が許す場合は、初期ビルドと緊急でないバックフィルにこれらを使用します。
  7. 段階的に埋め込みます。 変更されていないコンテンツが再処理されないように、安定したチャンク ID とコンテンツ ハッシュを維持します。
  8. スコープ検索。 プロバイダーの読み取り料金がスキャンされたデータに依存する場合は、テナントまたはコーパスごとに分割し、セキュリティのために同じ境界を強制します。
  9. 信頼できる情報源をインデックスの外に保存します。 再現可能な取り込みにより、プロバイダーの移行と再インデックス作成がより安全になります。
  10. 有用な回答ごとのコストを追跡します。 低コストのインデックスの取得率が低いと、再ランキング、生成、サポート、およびユーザーの再試行のコストが増加する可能性があります。

ベクトル化スタックを構築するべきですか、それともマネージド RAG を使用するべきですか?

取得が製品の利点の一部であり、解析、チャンク、埋め込み、インデックス、融合、再ランキング、評価、データ配置を直接制御する必要がある場合は、スタックを構築します。これらの制御によって測定可能な製品の成果が向上する場合、エンジニアリングの努力は正当化されます。

従業員や顧客が承認された会社の知識について質問できるようにすることが目的の場合、すべての層を管理する必要はないかもしれません。あ RAG-as-a-service 製品パッケージの取り込み、取得、権限、モデルのオーケストレーション、アシスタントのエクスペリエンス。セキュリティを重視した展開については、次のガイドを参照してください。 プライベートクラウドのRAG より広範な境界の決定をカバーします。

適切な比較は、管理対象製品のサブスクリプションと埋め込みトークンではありません。これは、管理されたサブスクリプションと、ベンダーの請求書、インフラストラクチャ、実装、評価、メンテナンス、インシデント対応など、信頼性の高いパイプラインの全コストを比較したものです。

実用的なベクトル化予算のチェックリスト

  • ページやファイルのみに依存するのではなく、代表的なサンプルからソース トークンをカウントします。
  • チャンク サイズとオーバーラップを記録し、繰り返されるトークンを計算します。
  • 少なくとも 2 つの埋め込みモデルとその出力次元の価格を決定します。
  • チャンク、生のベクター バイト、メタデータ、ソース テキスト、インデックス オーバーヘッド、ヘッドルーム、レプリカを推定します。
  • 必要に応じて、ページ、画像、またはトークンごとに解析または OCR を含めます。
  • 毎月の書き込み、削除、読み取り、再ランキング、出力、およびクエリの埋め込みをモデル化します。
  • 1 回の完全なインデックスの再作成とデュアル インデックスのカットオーバー用に容量を予約します。
  • バックアップ、復元のテスト、モニタリング、サポート、フルロードされたエンジニアリング時間が含まれます。
  • 最終候補リストに選ばれたデータベースをコーパス上で実行し、リコール、レイテンシ、スループット、コストをまとめて測定します。

よくある質問

100 万ページをベクトル化するにはいくらかかりますか?

このガイドの前提条件 (1 ページあたり 500 ワード、1 ワードあたり 1.33 トークン、500 トークン チャンク、および 50 トークンのオーバーラップ) の下では、100 万ページで約 7 億 3,890 万の埋め込みトークンが生成されます。現在のオンライン公開価格では、OpenAI text-embedding-3-small の場合は約 14.78 ドル、text-embedding-3-large の場合は 96.06 ドル、Gemini Embedding の場合は 110.83 ドルかかります。オプションの解析、データベースのストレージとインデックス、書き込み、クエリ、レプリカ、および労力が追加されます。すべてのページが記載されている API レートで処理された場合、Cohere Parse は 1,500 ドル追加されます。

Google は自動ベクトル化を提供していますか?

はい。 Google Agent Retrieval は、取り込みワークフローでの自動埋め込みをサポートしています。 Google のドキュメントには、Gemini API が使用されており、選択した埋め込みモデルは個別に請求されると記載されています。また、関連する Agent Retrieval ストレージ、容量、読み取り、書き込み、または取り込みメーターの料金も支払います。

Supabase にはベクトル化が含まれますか?

Supabase には Postgres が含まれており、ストレージと類似性検索のために pgvector をサポートします。自動埋め込みパイプラインとエッジ機能モデルについて文書化していますが、データベース計画は包括的な埋め込みトークンの許容量ではありません。エッジ関数の使用量、外部埋め込み API の料金 (該当する場合)、インデックスに必要なデータベースのコンピューティングとディスクが含まれます。

SingleStore は埋め込みを作成できますか?

SingleStore はベクトル データと検索をサポートしており、その AI 関数はサポートされている構成で SQL から埋め込みモデルを呼び出すことができます。データベースのコンピューティングとモデル推論を別個の項目として扱い、使用する予定の正確な機能とプロバイダーの可用性と請求を確認します。

Pinecone の RAG の価格はいくらですか?

Pinecone には、無料の Starter プラン、月額 20 ドルの Builder プラン、Standard の月額最低 50 ドル、レビュー時点での Enterprise の最低 500 ドルがあります。サーバーレスを使用すると、ストレージ、書き込み、読み取り、インポート、再ランキング、およびその他の選択された機能が追加されます。読み取りユニットはクエリの対象となるデータに依存するため、ストレージだけを使用するのではなく、名前空間のサイズとトラフィックを考慮して見積もります。

100 万個のベクターにはどれくらいのストレージが必要ですか?

1,536 次元の float32 ベクトル 100 万個には、約 5.72 GiB の生のベクトル データが必要です。これには、ID、メタデータ、ソース テキスト、近似検索インデックス、レプリカ、バックアップ、ヘッドルームは含まれません。 Float16 または量子化ではベクトル部分を減らすことができますが、次元やレプリカが大きくなるとベクトル部分が増加します。

データベースをベクトル化する必要があるのは 1 回だけですか?

いいえ。新しいコンテンツと変更されたコンテンツは埋め込む必要があり、削除はインデックスに到達する必要があり、新しい埋め込みモデルまたはチャンク戦略では完全な再構築が必要になる場合があります。コンテンツのハッシュ、安定したチャンク ID、モデルとチャンカーのバージョンを保存して、増分更新して変更内容を監査できるようにします。

RAG の最も安いベクター データベースは何ですか?

最も安価なオプションは、多くの場合、既に運用している有能なデータベースです。既存の Postgres デプロイメント内の pgvector、既存の MongoDB クラスター内の Vector Search、または検索が既にスタックの一部である場合の Elasticsearch です。新しい小規模なワークロードの場合、無料のサーバーレス層の方が安価になる可能性があります。大規模な安定したワークロードの場合は、専用またはセルフホスト型の容量が最適な場合があります。同じリコール、レイテンシ、可用性、セキュリティ目標での総コストを比較します。

結論

テキスト埋め込みの価格は大幅に下がったため、最初のコーパスのベクトル化が驚くほど安くなる可能性があります。このガイドの 100 万ページの例では、埋め込みに数千ドルではなく、数十ドルから 100 ドル強かかります。最初のベクトルが書き込まれた後も解析、データベースの提供、クエリの量、高可用性、再ランキング、生成、および操作が繰り返し行われるため、RAG システム全体のコストが高くなる可能性があります。

測定されたトークンとチャンクから見積もりを作成し、すべての仮定を可視化して、1 つのワークロードを使用してプロバイダーを比較します。あなたの目標がカスタム検索プラットフォームではなく、役立つ企業ナレッジ アシスタントである場合、 Cody アシスタントを構築する 大規模なインフラストラクチャ設計に着手する前に、実際の質問をテストします。

最初のアシスタントは数分の距離にあります

ビジネス知識を活用しましょう。

無料の Cody アカウントから始めてください。コンテンツを追加し、アシスタントを構築し、最初の役立つ回答を今すぐ共有してください。