• Base de connaissances sur l'IA
  • Intelligence artificielle

Combien coûte la vectorisation d’une base de données pour RAG ?

Découvrez ce qu'il en coûte réellement pour vectoriser une base de données pour RAG, depuis les intégrations et l'analyse jusqu'au stockage vectoriel, aux requêtes, aux réplicas et à la réindexation.

Par Oriol ZertucheTemps de lecture: 26 minutes
Les documents commerciaux se transforment en vecteurs d'intégration géométrique et en un index de récupération RAG organisé.

La vectorisation d'une base de données pour la génération augmentée par récupération (RAG) peut coûter quelques centimes pour une petite base de connaissances ou des milliers de dollars pour un corpus volumineux et changeant fréquemment. Ce qui est surprenant, c’est que l’API d’intégration représente souvent l’une des dépenses les plus minimes. L'analyse des documents, la capacité de la base de données vectorielles, le trafic des requêtes, les répliques, le reclassement, l'évaluation et la réindexation peuvent coûter plus cher que la génération des vecteurs.

La réponse en 30 secondes : Aux prix catalogue publics en ligne révisés le 2 septembre 2026, l'intégration de 100 millions de jetons de texte coûte environ 2$ à 20$ parmi les modèles traditionnels comparés ci-dessous. Dans notre exemple concret, la vectorisation d'un million de pages de 500 mots coûte environ 15 $ avec OpenAI text-embedding-3-small, 96 $ avec text-embedding-3-large ou 111 $ avec Gemini Embedding. Si chaque page nécessite également Cohere Parse à 1,50 $ pour 1 000 pages, l'analyse ajoute $1,500. Le stockage, les index, les requêtes, les écritures, les répliques, les sauvegardes et l'ingénierie sont distincts.

Ce guide montre les formules derrière ces chiffres, compare les prix de l'intégration et des bases de données vectorielles et explique où s'adaptent Pinecone, Google Agent Retrieval, SingleStore, Supabase, Qdrant, Weaviate, Zilliz, Chroma, Elasticsearch, MongoDB et pgvector. Les prix changent, alors considérez chaque chiffre du fournisseur comme une entrée de planification datée et vérifiez la région et le plan que vous avez l'intention d'utiliser.

Que comprend réellement la « vectorisation d’une base de données » ?

La vectorisation est couramment utilisée comme raccourci pour appeler un modèle d'intégration. Un index RAG fonctionnel comporte plusieurs étapes. Si vous êtes nouveau dans le pipeline de récupération complète, commencez par notre API RAG et explicatif de génération augmentée par récupération.

  1. Extraire et analyser : lire du texte, des tableaux, des images, des mises en page et des métadonnées à partir de fichiers ou d'enregistrements d'application.
  2. Nettoyer et découper : supprimez le bruit, préservez la structure utile, divisez le contenu en passages récupérables et superposez des morceaux lorsque le contexte serait autrement rompu.
  3. Générer des intégrations : envoyez chaque morceau à un modèle d'intégration ou exécutez un modèle sur votre propre infrastructure.
  4. Écrire et indexer : stocker des vecteurs, du texte, des identifiants de source, des horodatages, des identifiants de locataire et des métadonnées d'autorisation ; puis créez ou mettez à jour l'index de recherche.
  5. Servir la récupération : intégrez des requêtes, exécutez des recherches denses ou hybrides, filtrez les résultats et éventuellement reclassez les candidats.
  6. Gérer le cycle de vie : synchronisez les modifications, supprimez le contenu révoqué, sauvegardez les données, surveillez la qualité et réintégrez lorsque le modèle ou la stratégie de segmentation change.

Une citation qui couvre uniquement l’intégration de jetons répond à une question précise : « Combien coûtera le premier appel d’API ? Un budget utile doit répondre à la question : « Quel sera le coût pour maintenir un contexte pertinent et sécurisé, disponible avec la latence et le trafic que nous prévoyons ? »

La formule de coût pour un index vectoriel RAG

Vous pouvez estimer la construction initiale avec cinq entrées : jetons source, taille de bloc, chevauchement de bloc, dimensions vectorielles et octets par dimension. Laissez T être des jetons source, C la taille des morceaux, et Ô chevauchement :

  • Jetons intégrés ≈ T × C ÷ (C − O)
  • Nombre de morceaux ≈ T ÷ (C − O)
  • Coût de l'intégration de l'API = jetons intégrés ÷ 1 000 000 × prix du modèle par million de jetons
  • Octets vectoriels bruts = morceaux × dimensions × octets par dimension × répliques
  • Coût d'intégration des requêtes = requêtes × jetons de requête moyens ÷ 1 000 000 × prix du modèle

Le chevauchement est important car le texte répété est intégré à plusieurs reprises. Un morceau de 500 jetons avec un chevauchement de 50 jetons ajoute environ 11,1 % à la facture de jetons par rapport à l'absence de chevauchement. Les octets vectoriels bruts ne constituent pas une estimation de la capacité d'une base de données : les métadonnées, le texte stocké, les index approximatifs du voisin le plus proche, les journaux d'écriture anticipée, les répliques, les sauvegardes, l'espace de compactage temporaire et la marge opérationnelle s'y ajoutent tous.

Si votre mesure source est constituée de pages plutôt que de jetons, une conversion de planification pratique est :

Jetons sources ≈ pages × mots moyens par page × jetons par mot.

Le texte commercial anglais est souvent modélisé à environ 1,3 jetons par mot pour une estimation approximative. Les PDF contenant des tableaux, des erreurs OCR, du code, des identifiants ou plusieurs langues peuvent différer considérablement. Mesurez un échantillon du corpus réel avant d’approuver un budget important.

Comparaison des coûts d'intégration : que coûtent 100 millions de jetons ?

Le tableau utilise les prix publics de saisie de texte en ligne disponibles le 2 septembre 2026. Il exclut intentionnellement les allocations gratuites, les contrats négociés, le trafic de nouvelles tentatives, le chevauchement de fragments et la réintégration future. Les prix des lots peuvent être inférieurs lorsqu'un fournisseur les prend en charge.

Modèle d'intégrationPrix d'entrée en ligneCoût pour 100 millions de jetonsDétail important des prix
OpenAI intégration de texte-3-small0,02 $ / 1 million de jetons$21 536 dimensions par défaut ; les dimensions peuvent être réduites.
Voyage 4 Lite0,02 $ / 1 million de jetons$2Voyage publie des allocations de jetons gratuits et une remise sur l'API Batch ; l’éligibilité est importante.
Voyage 40,06 $ / 1 million de jetons$6Prend en charge les dimensions de sortie et la quantification flexibles.
Voyage 4 Grand0,12 $ / 1 million de jetons$12Le prix plus élevé du modèle peut encore être mineur en dehors de l'analyse et du service.
OpenAI intégration de texte-3-large0,13 $ / 1 million de jetons$133 072 dimensions par défaut ; des vecteurs plus grands peuvent augmenter la capacité de la base de données.
Gemini Embedding0,15 $ / 1 million de jetons$15Google répertorie 0,12 $/1 million pour la saisie par lots.
Gemini Embedding 2 Aperçu, texte0,20 $ / 1 million de jetons$20Google répertorie 0,10 $/1 million pour le texte par lots ; l'image, la vidéo et l'audio utilisent des unités et des tarifs différents.
Graphique à barres comparant les coûts de l'API d'intégration publique pour 100 millions de jetons de texte, de deux dollars pour OpenAI text-embedding-3-small et Voyage 4 Lite à vingt dollars pour Gemini Embedding 2 Preview
Comparaison publique des prix catalogue en ligne pour 100 millions de jetons de texte, révisée le 2 septembre 2026. Les niveaux gratuits, les remises par lots, les chevauchements, les tentatives et la réintégration sont exclus.

Pour connaître les capacités et les limites du prix de l'aperçu multimodal de Google, consultez notre Guide Gemini Embedding 2.

Le prix symbolique le plus bas n’est pas nécessairement le coût total le plus bas. Un modèle nécessitant moins de dimensions peut réduire le stockage et la mémoire. Un modèle qui récupère mieux peut réduire le reclassement ou le gaspillage de génération. À l’inverse, un modèle coûteux peut produire des vecteurs plus grands sans améliorer votre domaine. Comparez les modèles sur un ensemble de récupération étiqueté avant de multiplier un benchmark public par des milliards de morceaux.

Exemples travaillés : de 10 000 à 10 millions de pages

Pour rendre les calculs reproductibles, les scénarios suivants supposent 500 mots par page, 1,33 jetons par mot, des morceaux de 500 jetons, un chevauchement de 50 jetons, des vecteurs float32 de 1 536 dimensions et une copie de chaque vecteur. Ils excluent l'analyse, les métadonnées, les index, les répliques, les sauvegardes, les lectures, les écritures et la main-d'œuvre.

CorpusJetons sourcesJetons intégrésEnv. morceauxVecteurs brutsOpenAI petitOpenAI grand
10 000 pages6,65 millions7,39 millions14,7780,08 Gio$0.15$0.96
100 000 pages66,5 millions73,9 millions147,7780,85 Gio$1.48$9.61
1 million de pages665M738,9 millions1,48M8,46 Gio$14.78$96.06
10 millions de pages6,65B7.39B14,78 millions84,56 Gio$147.78$960.56

Pour la ligne d'un million de pages, Gemini Embedding à 0,15 $ par million de jetons d'entrée coûterait environ 110,83 $. Ces chiffres montrent pourquoi « les intégrations coûtent cher » peuvent être une fausse hypothèse pour le texte. A la même échelle, Cohere Parse indique le prix de l'API de 1,50 $ pour 1 000 pages, ou de 1 500 $ si la totalité d'un million de pages est analysée. Une meilleure analyse peut en valoir la peine, en particulier pour les tableaux, les formulaires, les diapositives et les PDF complexes, mais elle doit être modélisée comme un élément de ligne distinct. Notre Guide Cohere Parse v5 explique ce compromis plus en détail.

Infographie montrant comment un million de pages deviennent 738,9 millions de jetons intégrés, environ 1,48 millions de morceaux, 8,46 Gio de vecteurs bruts et des couches distinctes d'analyse, d'intégration et de coûts de base de données
Un exemple transparent d’un million de pages. La base de données et les couches opérationnelles sont additives et dépendent du fournisseur, de l'index, du trafic, de la réplication et du niveau de service sélectionnés.

De quelle quantité de stockage vectoriel avez-vous besoin ?

Pour les vecteurs float32 denses, chaque dimension utilise quatre octets. Un vecteur à 1 536 dimensions a donc besoin de 6 144 octets bruts, soit environ 6 Ko, avant tout index ou métadonnée. Les 1,48 millions de fragments de notre exemple produisent environ 8,46 Gio de vecteurs bruts.

Conseils de planification de capacité du Qdrant utilise la même formule de base et estime séparément les liens HNSW, les charges utiles, les index de charge utile, la réplication et la marge. Ces ajouts expliquent pourquoi multiplier des vecteurs par des dimensions est un plancher, pas une facture. Les index de recherche approximative peuvent occuper une mémoire importante ; Le texte en bloc stocké et les métadonnées riches peuvent l'emporter sur les vecteurs compressés ; les répliques multiplient les données ; et une migration peut nécessiter deux index complets à la fois.

La précision est l’un des principaux leviers. Float16 réduit les octets vectoriels bruts environ de moitié ; La quantification scalaire sur 8 bits peut les réduire environ par quatre ; les techniques binaires et de quantification de produits peuvent aller plus loin. Conseils de quantification rend également claire la mise en garde essentielle : la compression échange la précision contre des économies de ressources. Mesurez le rappel et la qualité du classement sur votre propre corpus avant de traiter un taux de compression comme de l'argent gratuit.

Comparaison des coûts de la base de données vectorielles pour RAG

Les prix des bases de données vectorielles sont plus difficiles à comparer que les prix de l'intégration, car les fournisseurs mesurent différents éléments : engagements minimum du plan, heures de calcul, dimensions, unités de lecture ou d'écriture, Gio stockés, vCU, données transférées ou des combinaisons de ceux-ci. Le tableau suivant est une carte de planification et non un point de référence normalisé.

FournisseurForme des prix publicsComment fonctionne la vectorisationMeilleur rapport coût / mise en garde
PineconeDémarreur gratuit ; Constructeur 20$/mois; Standard a un minimum de 50 $/mois ; Enterprise a un minimum de 500 $/mois. L'utilisation sans serveur ajoute du stockage, des lectures, des écritures, des importations et d'autres fonctionnalités. Un exemple actuel d'AWS us-east-1 répertorie 0,33 $/Go par mois de stockage et 16 $ par million d'unités de lecture, avec des taux d'écriture variant selon le plan.Apportez des vecteurs ou utilisez des flux de travail intégrés d'intégration et de reclassement ; les frais et les limites des modèles doivent être inclus.Faibles opérations et utilisation élastique. Les unités de lecture dépendent des données ciblées par une requête, la conception de l'espace de noms affecte donc le coût.
Récupération des agents GoogleStockage basé sur l'utilisation, lectures, écritures, ingestion de données et unités de capacité. Les tarifs publics incluent environ 0,000410959 $/Gio-heure stockée, 0,06 $ pour 100 000 lectures et 0,18 $ pour 100 000 écritures ; les unités de performance et de capacité de stockage sont distinctes.Prend en charge les intégrations automatiques, la recherche hybride et le reclassement sémantique. Google indique que le modèle d'intégration Gemini sélectionné est facturé séparément.Attrayant pour un pipeline natif de Google Cloud, mais « automatique » ne signifie pas que l'intégration est gratuite.
Magasin unique HéliosNiveau partagé gratuit ; La norme S-00 commence à 0,99 $/heure, soit environ 723 $ pour un mois de 730 heures, plus stockage. Les multiplicateurs Multi-AZ et Enterprise augmentent le calcul.Stocke les vecteurs avec les données relationnelles et prend en charge la recherche de vecteurs. Les fonctions d'IA peuvent invoquer des modèles à partir de SQL ; vérifier l’état de l’aperçu et séparer les frais de modèle ou d’inférence.Fort lorsque les charges de travail transactionnelles, analytiques et vectorielles vont de pair. Le niveau de calcul permanent est élevé pour un petit projet uniquement vectoriel.
Supabase + pgvectorFree comprend une base de données de 500 Mo. Pro coûte 25 $/mois et comprend 10 $ de crédits de calcul ; le disque de base de données comprend 8 Go, puis répertorie 0,125 $/Go. Calculez les échelles de Micro vers le haut.pgvector stocke et recherche des vecteurs. Supabase documente les fonctions Edge et les modèles d'intégration automatique, y compris les modèles locaux et les API externes ; L'utilisation de l'intégration externe est distincte.Excellent lorsque l'application utilise déjà Postgres, l'authentification et la sécurité au niveau des lignes. La mémoire d'indexation et le calcul de la base de données (et non des « frais vectoriels » spéciaux) déterminent généralement l'échelle.
Qdrant NuageCluster gratuit avec 1 Go de RAM et 4 Go de disque ; les clusters payants mesurent le processeur, la mémoire, le disque, les sauvegardes et l'inférence facultative toutes les heures.Apportez des vecteurs ou utilisez l'inférence cloud Qdrant si disponible.Dimensionnement transparent des ressources et chemin auto-hébergé open source. Un cluster de production auto-hébergé transfère les frais de cloud dans l'infrastructure et le temps de l'opérateur.
Weaviate NuageBac à sable gratuit ; Flex commence à 45 $/mois ; La prime commence à 400 $/mois. Flex répertorie les compteurs de dimension vectorielle, de stockage et de sauvegarde.Apportez des vecteurs ou utilisez des modules de vectorisation intégrés ; Les frais de jeton de modèle hébergé peuvent être distincts.Utile lorsque la recherche hybride et les modèles intégrés réduisent le travail des applications. La tarification basée sur les dimensions rend le nombre de morceaux et la taille des vecteurs particulièrement visibles.
Nuage Zilliz / MilvusLe sans serveur répertorie 4 $ par million de vCU plus le stockage. Les exemples de fournisseurs estiment environ 6 dollars pour écrire un million de vecteurs à 1 536 dimensions et environ 100 dollars pour un million de recherches sur une collection d'un million de vecteurs, avant les autres services.Les intégrations proviennent normalement d’un modèle externe ou géré par l’application.Entrée sans serveur avec un chemin compatible Milvus. Les coûts de recherche changent en fonction de la taille de la collection, des dimensions vectorielles, du top-k, des filtres et de la charge de travail.
Nuage ChromaStarter est basé sur l'utilisation avec des crédits ; les compteurs publics indiquent 2,50 $/GiB écrit, 0,33 $/GiB par mois stocké, 0,0075 $/TiB interrogé et 0,09 $/GiB renvoyés. L'équipe coûte 250 $/mois plus l'utilisation avec des crédits.Peut fonctionner avec des vecteurs générés par l’application et des intégrations d’intégration.Dosage simple et développement rapide. Les hypothèses relatives aux données renvoyées et au volume de requêtes sont importantes à grande échelle.
Elastic Cloud sans serveurLa recherche, l'ingestion, les VCU d'apprentissage automatique, le stockage et la sortie sont mesurés séparément ; les profils vectoriels incluent une allocation et l'inférence commence à un taux par jeton.Elastic prend en charge les vecteurs denses et clairsemés, ainsi que les points de terminaison d'inférence et la recherche hybride.Idéal lorsque la recherche lexicale, les filtres et l’observabilité justifient une plateforme plus large. Comptez la capacité d’ingest et de recherche, pas seulement les Go stockés.
Recherche de vecteurs Atlas MongoDBCoût du cluster Atlas plus nœuds de recherche ou ressources partagées. Un nœud de recherche S20 est coté publiquement à partir de 0,12 $/heure sur AWS ; les déploiements de recherche dédiés nécessitent au moins deux nœuds, ce qui représente un plancher de nœud de recherche d'environ 175 $/mois avant le cluster de base de données.Stockez les intégrations à côté des documents ; les intégrations d’applications ou de modèles les génèrent.Ajustement architectural économique lorsqu'Atlas possède déjà les données JSON. Un projet uniquement vectoriel doit toujours payer pour la couche de base de données.
pgvector auto-hébergéPas de frais de licence pgvector distincts ; payez pour le calcul, la mémoire, le disque, les répliques, les sauvegardes, le réseau et les opérations Postgres. Les fournisseurs Postgres gérés ajoutent leurs propres compteurs.Générez des intégrations dans l'application, une fonction de base de données ou un service connecté.Souvent le choix le moins complexe pour une équipe Postgres existante. « Open source » n’est pas la même chose qu’un coût total nul.

Aperçu des tarifs révisé le 2 septembre 2026. Les tarifs peuvent varier selon le cloud, la région, le forfait, la réservation, le niveau de support et l'accord négocié. Suivez chaque page de tarification liée et modélisez votre propre modèle de requête avant d'acheter.

Pour connaître les différences qualitatives de récupération et de déploiement, utilisez ce guide parallèlement à notre comparaison mise à jour des principales bases de données vectorielles pour RAG.

Pinecone, Google, SingleStore et Supabase : en quoi les modèles de coûts diffèrent

Pinecone : compteurs d'utilisation plus un forfait minimum

Pinecone Serverless sépare le stockage, les écritures et les lectures. C'est documentation des coûts explique que les unités de lecture des requêtes évoluent en fonction de la taille de l'espace de noms ciblé par la recherche, avec des frais minimum par requête. Cela fait de la conception de données mutualisées une décision financière : un espace de noms par locataire peut limiter chaque recherche à moins de données, tandis qu'un espace de noms partagé peut amener une requête à toucher une collection plus grande, même lorsque les filtres de métadonnées renvoient un petit ensemble de résultats.

Pour la planification, séparez le minimum du forfait mensuel des opérations de données mesurées. Testez ensuite des tailles d'espace de noms réalistes, le top-k, le reclassement, les insertions par lots et le trafic. Une faible facture de stockage brut peut coexister avec une facture de lecture plus importante avec un volume de requêtes élevé.

Google Agent Retrieval : vectorisation automatique, facturée séparément

Google Agent Retrieval, précédemment introduit sous le nom de Vector Search 2.0, peut créer automatiquement des intégrations et ajoute une recherche hybride et un reclassement sémantique. La commodité supprime le code du pipeline, pas l’aspect économique : Aperçu de Google indique que l'intégration automatique utilise l'API Gemini, et la page de tarification indique que le modèle d'intégration sélectionné est facturé séparément.

Une estimation Google doit donc inclure au moins quatre couches : les jetons d'intégration Gemini, l'ingestion ou les écritures de données, les unités de capacité et de Gio stockés et les opérations de lecture. Comparez attentivement ce nouveau service basé sur l'utilisation avec la recherche de vecteurs standard Vertex AI ; l'ancien produit dispose de différents compteurs de création d'index, de mise à jour en streaming et de nœuds de desserte.

SingleStore : recherche vectorielle au sein d'une plateforme de données toujours active

SingleStore peut conserver des vecteurs, des enregistrements relationnels, des champs de texte intégral et des analyses dans un seul système SQL distribué. Cette consolidation peut supprimer les tâches de synchronisation et séparer l’infrastructure. Le compromis est que la taille de calcul payante d'entrée est un espace de travail de base de données toujours actif, et non quelques dollars de stockage vectoriel sans serveur.

Utilisez SingleStore lorsque la charge de travail combinée génère ce calcul : les données opérationnelles, les analyses, la recherche en texte intégral et la récupération vectorielle peuvent partager une seule plateforme. Si vous n'avez besoin que d'un petit index de documents, comparez son plancher de calcul S-00 mensuel d'environ 723 $ avec les options sans serveur ou Postgres existantes. Si les fonctions d'IA appellent un modèle d'intégration à partir de SQL, confirmez quelle fonction est généralement disponible et qui facture l'inférence.

Supabase : pgvector est inclus, la génération d'intégration est un choix distinct

Supabase fournit à Postgres l'extension pgvector, il n'y a donc pas de produit de base de données distinct par vecteur à acheter. La facture est déterminée par le plan Supabase, le calcul de la base de données, le disque, la sortie et tout service d'intégration que vous appelez. La base de 25 $ d'un projet Pro comprend des crédits de calcul, mais des index plus volumineux ou des requêtes plus lourdes peuvent nécessiter plus de mémoire et une taille de calcul plus grande.

Supabase publie également modèles d'intégration automatique à l'aide de déclencheurs, de files d'attente, de fonctions Edge et d'un fournisseur d'intégration. Ses fonctions Edge peuvent exécuter certains modèles intégrés, tandis que d'autres exemples appellent OpenAI. Dans les deux cas, « automatique » décrit l’orchestration. Le coût réel réside dans l’utilisation de Edge Function, les ressources de base de données et toute facture de modèle externe.

Géré ou auto-hébergé : qu'est-ce qui est le moins cher ?

ApprocheAvantages en termes de coûtsLes coûts échappent aux gensGénéralement meilleur quand
Sans serveur géréPeu de capacité inutilisée, configuration rapide, mise à l'échelle automatisée, sauvegardes et mises à niveau incluses ou disponibles.Planifiez les minimums, les unités de lecture/écriture, la sortie, les niveaux de support, les régions premium et moins de contrôle sur le réglage au niveau de l'index.Le trafic est incertain ou l'équipe a peu de capacité d'exploitation de bases de données.
Géré dédiéCapacité et soutien prévisibles ; un réseautage privé plus facile et des objectifs de niveau de service.Nœuds inactifs, réplicas, tailles minimales de cluster, surprovisionnement et engagements de support.Le trafic est soutenu et prévisible ou la conformité nécessite une empreinte dédiée.
Base de données existante avec des vecteursRéutilise les données, les autorisations, les sauvegardes, les compétences et les contrats des fournisseurs ; moins de chemins de synchronisation.Les index vectoriels sont en concurrence avec les charges de travail transactionnelles ; les mises à niveau de mémoire et les réplicas en lecture peuvent être coûteux.Postgres, Elasticsearch, MongoDB ou SingleStore possèdent déjà la source de vérité.
Moteur spécialisé auto-hébergéAucune marge de service géré ; contrôle maximal du placement et du réglage ; portabilité open source.Ingénierie, astreinte, mises à niveau, sécurité, surveillance, capacité, sauvegardes, tests de restauration et risque d'indisponibilité.L'échelle est importante et stable, ou le contrôle du déploiement est une exigence ferme soutenue par une équipe opérationnelle.

L'auto-hébergement ne devient moins cher que lorsque l'infrastructure et la main d'œuvre économisées dépassent le travail que vous effectuez. Un cluster de production à deux ou trois nœuds, les sauvegardes, la surveillance, la mise en réseau privée, la réponse aux incidents et le temps d'un ingénieur peuvent submerger une petite facture gérée. Avec des charges de travail constantes et très importantes, un auto-hébergement bien géré peut devenir économique, mais ce croisement doit être calculé avec des exigences de main-d'œuvre et de fiabilité à pleine charge.

Comment le coût évolue du prototype à l'échelle de l'entreprise

Prototype : prouver la qualité de la récupération avant d'acheter de la capacité

Un prototype comportant des dizaines de milliers de pages peut souvent s'adapter à des niveaux gratuits ou à une petite instance Postgres existante. Le coût d’intégration peut être bien inférieur à un dollar. Dépensez votre maigre budget pour un échantillon de document représentatif, des questions difficiles, des tests d'autorisation et une évaluation. Évitez les décisions d’architecture basées sur la latence d’une petite démo.

Production : le trafic et la fiabilité remplacent l'intégration comme principales variables

Entre des centaines de milliers et quelques millions de pages, les vecteurs bruts peuvent encore contenir des dizaines de Gio, mais la latence p95, les utilisateurs simultanés, le filtrage, la fraîcheur de l'ingestion et le dimensionnement des disques haute disponibilité. Modélisez les unités de lecture de requête, la mémoire de la base de données, deux répliques ou plus, les sauvegardes et une réindexation complète. Coût de l'instrument par réponse fondée réussie, et pas seulement par requête.

Entreprise : la gouvernance et le cycle de vie dominent

Pour des dizaines de millions de pages ou des limites de conformité strictes, la segmentation du corpus, l'isolement des locataires, la mise en réseau privée, les copies régionales, les objectifs de restauration, les preuves de suppression, les journaux d'audit, les suites d'évaluation et la capacité de migration sont tous importants. Un accord négocié peut rendre les prix publics moins pertinents, mais il ne supprime pas la nécessité d’une économie unitaire basée sur la charge de travail.

Huit coûts cachés dans un budget de vectorisation

  1. Analyse et OCR : Les PDF complexes, les numérisations, les tableaux et les documents contenant beaucoup d'images peuvent nécessiter un analyseur ou un modèle de vision payant.
  2. Chevauchement et doublons de morceaux : le texte répété, le passe-partout, les versions et les copies gonflent les jetons et les vecteurs sans augmenter les connaissances.
  3. Métadonnées et texte source : la charge utile autour d'un vecteur de 6 Ko peut être plus grande que le vecteur.
  4. Indexer la mémoire et le temps de construction : Les graphiques HNSW, les index de charge utile, le compactage et les reconstructions nécessitent un espace de travail et des calculs.
  5. Requêtes, reclassement et génération : l'intégration d'une courte requête est peu coûteuse ; rechercher de grandes collections, reclasser des dizaines de candidats et générer de longues réponses peut être une facture récurrente.
  6. Réplication et récupération : deux répliques doublent environ les données vectorielles stockées, tandis que les sauvegardes et les copies inter-régions en ajoutent davantage.
  7. Modification de la capture et de la suppression des données : les connecteurs, les files d'attente, les tentatives, les pierres tombales et la synchronisation des autorisations nécessitent à la fois une infrastructure et une ingénierie.
  8. Réintégration et migration : un nouveau modèle ou un nouveau chunker peut nécessiter un deuxième index complet lors du remplissage, augmentant temporairement les coûts de stockage et d'écriture.

Les intégrations de requêtes sont généralement triviales isolément. Un million de questions à 20 jetons équivaut à 20 millions de jetons d'entrée : environ 0,40 $ avec OpenAI text-embedding-3-small, 2,60 $ avec text-embedding-3-large ou 3 $ avec Gemini Embedding aux tarifs ci-dessus. Les lectures de bases de données, le reclassement et la génération de réponses constitueront probablement les coûts récurrents les plus importants.

Comment réduire les coûts de vectorisation sans nuire à la qualité du RAG

  1. Dédupliquez avant l'intégration. Hachez les morceaux normalisés et évitez d’indexer des versions standard ou de fichiers identiques.
  2. Choisissez le découpage avec évaluation. Des morceaux plus gros réduisent le nombre de vecteurs mais peuvent diluer la récupération ; un chevauchement excessif répète les jetons. Adaptez les deux à de vraies questions.
  3. Utilisez le plus petit modèle d’intégration efficace. Comparez Recall@k, nDCG, la précision des réponses en aval, la latence, les dimensions et le prix, et pas seulement la taille du modèle.
  4. Réduisez délibérément les dimensions. OpenAI et Voyage documentent des dimensions flexibles. Les vecteurs plus petits économisent du stockage et de la mémoire ; valider d'abord la qualité.
  5. Quantifiez après avoir établi une ligne de base. Les vecteurs Float16 ou 8 bits peuvent réduire la mémoire, mais mesurent le rappel avant et après.
  6. Regroupez des tâches hors ligne. Google et Voyage publient des chemins de lots à prix réduit. Utilisez-les pour les builds initiales et les remplissages non urgents lorsque les limites de service le permettent.
  7. Intégrez progressivement. Conservez des ID de bloc et des hachages de contenu stables afin que le contenu inchangé ne soit pas retraité.
  8. Recherches de portée. Partitionnez par locataire ou corpus lorsque le tarif de lecture du fournisseur dépend des données analysées et appliquez les mêmes limites de sécurité.
  9. Stockez la source de vérité en dehors de l'index. L’ingestion reproductible rend la migration et la réindexation des fournisseurs plus sûres.
  10. Suivez le coût par réponse utile. Un index moins cher dont la récupération est médiocre peut augmenter les coûts de reclassement, de génération, de support et de nouvelle tentative de l'utilisateur.

Devez-vous créer la pile de vectorisation ou utiliser RAG géré ?

Créez la pile lorsque la récupération fait partie de l'avantage de votre produit et que vous avez besoin d'un contrôle direct sur l'analyse, le regroupement, les intégrations, les index, la fusion, le reclassement, l'évaluation et le placement des données. L'effort d'ingénierie peut être justifié lorsque ces contrôles améliorent un résultat mesurable du produit.

Si l’objectif est de permettre aux employés ou aux clients de poser des questions sur les connaissances approuvées de l’entreprise, la gestion de chaque niveau peut s’avérer inutile. Un RAG en tant que service ingestion de packages de produits, récupération, autorisations, orchestration de modèles et expérience d'assistant. Pour les déploiements sensibles à la sécurité, notre guide pour RAG dans les cloud privés couvre les décisions de délimitation plus larges.

La bonne comparaison n’est pas l’abonnement à un produit géré par rapport à l’intégration de jetons. Il s'agit d'un abonnement géré par rapport au coût total d'un pipeline fiable : factures des fournisseurs, infrastructure, mise en œuvre, évaluation, maintenance et réponse aux incidents.

Une liste de contrôle pratique du budget de vectorisation

  • Comptez les jetons source à partir d’un échantillon représentatif plutôt que de vous fier uniquement aux pages ou aux fichiers.
  • Enregistrez la taille et le chevauchement des morceaux, et calculez les jetons répétés.
  • Prix ​​d'au moins deux modèles d'intégration et leurs dimensions de sortie.
  • Estimez les morceaux, les octets vectoriels bruts, les métadonnées, le texte source, la surcharge d'index, la marge et les répliques.
  • Incluez l'analyse ou OCR par page, image ou jeton si nécessaire.
  • Modélisez les écritures, suppressions, lectures, reclassements, sorties et intégrations de requêtes mensuelles.
  • Réservez de la capacité pour une réindexation complète et un basculement à double index.
  • Incluez les sauvegardes, les tests de restauration, la surveillance, l’assistance et le temps d’ingénierie entièrement chargé.
  • Exécutez la base de données présélectionnée sur votre corpus et mesurez ensemble le rappel, la latence, le débit et le coût.

Questions fréquemment posées

Combien coûte la vectorisation d’un million de pages ?

Selon les hypothèses de ce guide (500 mots par page, 1,33 jetons par mot, morceaux de 500 jetons et chevauchement de 50 jetons), un million de pages produisent environ 738,9 millions de jetons intégrés. Cela coûte environ 14,78 $ avec OpenAI text-embedding-3-small, 96,06 $ avec text-embedding-3-large ou 110,83 $ avec Gemini Embedding aux prix publics en ligne actuels. L'analyse facultative, le stockage de base de données et les index, les écritures, les requêtes, les répliques et la main-d'œuvre sont supplémentaires. Cohere Parse ajouterait 1 500 $ si chaque page était traitée au tarif API indiqué.

Google propose-t-il la vectorisation automatique ?

Oui. Google Agent Retrieval prend en charge les intégrations automatiques dans son flux de travail d'ingestion. La documentation de Google indique qu'il utilise l'API Gemini et que le modèle d'intégration sélectionné est facturé séparément. Vous payez également les compteurs de stockage, de capacité, de lecture, d'écriture ou d'ingestion de récupération d'agent appropriés.

Supabase inclut-il la vectorisation ?

Supabase inclut Postgres et prend en charge pgvector pour le stockage et la recherche de similarité. Il documente les pipelines d'intégration automatique et les modèles de fonctions Edge, mais le plan de base de données ne constitue pas une allocation globale de jetons d'intégration. Incluez l'utilisation de la fonction Edge, les frais de l'API d'intégration externe, le cas échéant, ainsi que le calcul de la base de données et le disque nécessaires à l'index.

SingleStore peut-il créer des intégrations ?

SingleStore prend en charge les données vectorielles et la recherche, et ses fonctions d'IA peuvent appeler des modèles d'intégration à partir de SQL dans les configurations prises en charge. Traitez le calcul de base de données et l'inférence de modèle comme des éléments de campagne distincts, et vérifiez la disponibilité et la facturation de la fonction exacte et du fournisseur que vous envisagez d'utiliser.

Combien coûte Pinecone pour RAG ?

Pinecone propose un forfait Starter gratuit, un forfait Builder de 20 $ par mois, un minimum mensuel de 50 $ pour Standard et un minimum de 500 $ pour Enterprise au moment de l'examen. L'utilisation sans serveur ajoute du stockage, des écritures, des lectures, des importations, un reclassement et d'autres fonctionnalités sélectionnées. Étant donné que les unités de lecture dépendent des données ciblées par une requête, estimez la taille et le trafic de votre espace de noms au lieu d'utiliser uniquement le stockage.

De quelle quantité de stockage un million de vecteurs a-t-il besoin ?

Un million de vecteurs float32 de 1 536 dimensions nécessitent environ 5,72 Gio de données vectorielles brutes. Cela exclut les identifiants, les métadonnées, le texte source, l'index de recherche approximatif, les répliques, les sauvegardes et la marge. Float16 ou la quantification peuvent réduire la partie vectorielle, tandis que des dimensions et des répliques plus grandes l'augmentent.

Faut-il vectoriser une base de données une seule fois ?

Non. Le contenu nouveau et modifié doit être intégré, les suppressions doivent atteindre l'index, et un nouveau modèle d'intégration ou une nouvelle stratégie de segmentation peut nécessiter une reconstruction complète. Stockez les hachages de contenu, les ID de fragments stables et les versions de modèles et de fragments afin de pouvoir mettre à jour progressivement et auditer ce qui a changé.

Quelle est la base de données vectorielles la moins chère pour RAG ?

L'option la moins chère est souvent la base de données performante que vous exploitez déjà : pgvector dans un déploiement Postgres existant, Vector Search dans un cluster MongoDB existant ou Elasticsearch lorsque la recherche fait déjà partie de la pile. Pour une nouvelle petite charge de travail, les niveaux gratuits et sans serveur peuvent être moins coûteux. Pour une charge de travail importante et constante, une capacité dédiée ou auto-hébergée peut s'avérer avantageuse. Comparez le coût total pour les mêmes objectifs de rappel, de latence, de disponibilité et de sécurité.

L'essentiel

Les prix de l’intégration de texte ont suffisamment baissé pour que la vectorisation du corpus initial puisse être étonnamment bon marché. L’exemple d’un million de pages présenté dans ce guide coûte entre dix et un peu plus de cent dollars pour les intégrations, et non des milliers. L'ensemble du système RAG peut encore devenir coûteux car l'analyse, le service de base de données, le volume de requêtes, la haute disponibilité, le reclassement, la génération et les opérations se répètent longtemps après l'écriture du premier vecteur.

Construisez votre estimation à partir de jetons et de morceaux mesurés, gardez chaque hypothèse visible et comparez les fournisseurs en utilisant une seule charge de travail. Si votre objectif est de créer un assistant de connaissances utile pour l'entreprise plutôt qu'une plateforme de récupération personnalisée, créer un assistant Cody et testez de vraies questions avant de vous engager dans la conception d’une grande infrastructure.

Votre premier assistant est à quelques minutes

Mettez vos connaissances commerciales à profit.

Commencez avec un compte Cody gratuit. Ajoutez votre contenu, créez un assistant et partagez la première réponse utile dès aujourd'hui.