- Base de conhecimento de IA
- Inteligência artificial
Quanto custa vetorizar um banco de dados para RAG?
Saiba quanto realmente custa vetorizar um banco de dados para RAG, desde incorporações e análises até armazenamento vetorial, consultas, réplicas e reindexação.

A vetorização de um banco de dados para geração de recuperação aumentada (RAG) pode custar centavos para uma pequena base de conhecimento ou milhares de dólares para um corpus grande e que muda frequentemente. A parte surpreendente é que a API de incorporação costuma ser uma das menores despesas. A análise de documentos, a capacidade do banco de dados vetorial, o tráfego de consultas, as réplicas, a reclassificação, a avaliação e a reindexação podem custar mais do que gerar os vetores.
A resposta de 30 segundos: A preços de lista públicos online revisados em 2 de setembro de 2026, a incorporação de 100 milhões de tokens de texto custa aproximadamente $ 2 a $ 20 entre os modelos convencionais comparados abaixo. No nosso exemplo prático, vetorizar um milhão de páginas de 500 palavras custa cerca de US$ 15 com OpenAI text-embedding-3-small, US$ 96 com text-embedding-3-large ou US$ 111 com Gemini Embedding. Se cada página também precisar de Cohere Parse a US$ 1,50 por 1.000 páginas, a análise acrescenta $1,500. Armazenamento, índices, consultas, gravações, réplicas, backups e engenharia são separados.
Este guia mostra as fórmulas por trás desses números, compara preços de incorporação e banco de dados vetorial e explica onde Pinecone, Google Agent Retrieval, SingleStore, Supabase, Qdrant, Weaviate, Zilliz, Chroma, Elasticsearch, MongoDB e pgvector se encaixam. Os preços mudam, portanto, trate cada valor do fornecedor como uma entrada de planejamento datada e verifique a região e o plano que você pretende usar.
O que realmente inclui “vetorizar um banco de dados”?
A vetorização é comumente usada como um atalho para chamar um modelo de incorporação. Um índice RAG funcional possui mais etapas. Se você é novo no pipeline de recuperação completo, comece com nosso API RAG e explicador de geração aumentada de recuperação.
- Extraia e analise: leia textos, tabelas, imagens, layouts e metadados de arquivos ou registros de aplicativos.
- Limpo e em pedaços: remova o ruído, preserve a estrutura útil, divida o conteúdo em passagens recuperáveis e sobreponha pedaços quando o contexto seria interrompido.
- Gerar incorporações: envie cada pedaço para um modelo incorporado ou execute um modelo em sua própria infraestrutura.
- Escreva e indexe: armazenar vetores, texto, identificadores de origem, carimbos de data/hora, IDs de inquilinos e metadados de permissão; em seguida, crie ou atualize o índice de pesquisa.
- Servir recuperação: incorpore consultas, execute pesquisas densas ou híbridas, filtre resultados e, opcionalmente, reclassifique os candidatos.
- Operar o ciclo de vida: sincronizar alterações, excluir conteúdo revogado, fazer backup de dados, monitorar a qualidade e reincorporá-lo quando o modelo ou a estratégia de agrupamento mudar.
Uma cotação que cobre apenas a incorporação de tokens responde a uma pergunta restrita: “Quanto custará a primeira chamada de API?” Um orçamento útil deve responder “Quanto custará para manter o contexto relevante e seguro para permissão disponível na latência e no tráfego que esperamos?”
A fórmula de custo para um índice vetorial RAG
Você pode estimar a construção inicial com cinco entradas: tokens de origem, tamanho do bloco, sobreposição de blocos, dimensões vetoriais e bytes por dimensão. Deixe T ser tokens de origem, C tamanho do pedaço e Ó sobreposição:
- Tokens incorporados ≈ T × C ÷ (C - O)
- Número de pedaços ≈ T÷ (C − O)
- Custo da API de incorporação = tokens incorporados ÷ 1.000.000 × preço do modelo por milhão de tokens
- Bytes de vetor bruto = pedaços × dimensões × bytes por dimensão × réplicas
- Custo de incorporação de consulta = consultas × tokens de consulta médios ÷ 1.000.000 × preço do modelo
A sobreposição é importante porque o texto repetido é incorporado repetidamente. Um pedaço de 500 tokens com sobreposição de 50 tokens adiciona cerca de 11,1% à conta de tokens em comparação com nenhuma sobreposição. Os bytes vetoriais brutos não são uma estimativa de capacidade do banco de dados: metadados, texto armazenado, índices do vizinho mais próximo aproximado, logs de gravação antecipada, réplicas, backups, espaço de compactação temporário e espaço operacional, tudo isso é adicionado a ele.
Se a sua medida de origem for páginas em vez de tokens, uma conversão prática de planejamento é:
Tokens de origem ≈ páginas × média de palavras por página × tokens por palavra.
O texto comercial em inglês costuma ser modelado em cerca de 1,3 tokens por palavra para uma estimativa aproximada. PDFs com tabelas, erros OCR, códigos, identificadores ou vários idiomas podem diferir substancialmente. Meça uma amostra do corpus real antes de aprovar um grande orçamento.
Comparação de custos de incorporação: quanto custam 100 milhões de tokens?
A tabela utiliza preços públicos de entrada de texto online disponíveis em 2 de setembro de 2026. Ela exclui intencionalmente licenças gratuitas, contratos negociados, tráfego de novas tentativas, sobreposição de blocos e reincorporação futura. Os preços dos lotes podem ser mais baixos quando um provedor os oferece.
| Modelo de incorporação | Preço de entrada on-line | Custo para 100 milhões de tokens | Detalhe importante sobre preços |
|---|---|---|---|
| OpenAI incorporação de texto-3-pequeno | US$ 0,02/1 milhão de tokens | $2 | 1.536 dimensões por padrão; dimensões podem ser reduzidas. |
| Viagem 4 Lite | US$ 0,02/1 milhão de tokens | $2 | A Voyage publica permissões de tokens gratuitos e um desconto na API Batch; a elegibilidade é importante. |
| Viagem 4 | US$ 0,06/1 milhão de tokens | $6 | Suporta dimensões de saída flexíveis e quantização. |
| Viagem 4 Grande | US$ 0,12/1 milhão de tokens | $12 | O preço mais alto do modelo ainda pode ser menor em comparação com a análise e a veiculação. |
| OpenAI incorporação de texto-3-grande | US$ 0,13/1 milhão de tokens | $13 | 3.072 dimensões por padrão; vetores maiores podem aumentar a capacidade do banco de dados. |
| Gemini Embedding | US$ 0,15/1 milhão de tokens | $15 | O Google lista US$ 0,12/1 milhão para entrada em lote. |
| Gemini Embedding 2 Visualização, texto | US$ 0,20/1 milhão de tokens | $20 | Google lista US$ 0,10/1 milhão para texto em lote; imagem, vídeo e áudio usam unidades e taxas diferentes. |
Para conhecer os recursos e limites do preço de visualização multimodal do Google, consulte nosso Guia Gemini Embedding 2.
O preço simbólico mais baixo não é necessariamente o custo total mais baixo. Um modelo que necessita de menos dimensões pode reduzir armazenamento e memória. Um modelo que recupera melhor pode reduzir a reclassificação ou o desperdício de geração. Por outro lado, um modelo caro pode produzir vetores maiores sem melhorar o seu domínio. Compare modelos em um conjunto de recuperação rotulado antes de multiplicar um benchmark público por bilhões de blocos.
Exemplos resolvidos: de 10.000 a 10 milhões de páginas
Para tornar a matemática reproduzível, os cenários a seguir assumem 500 palavras por página, 1,33 tokens por palavra, pedaços de 500 tokens, sobreposição de 50 tokens, vetores float32 de 1.536 dimensões e uma cópia de cada vetor. Eles excluem análise, metadados, índices, réplicas, backups, leituras, gravações e mão de obra.
| Corpus | Tokens de origem | Tokens incorporados | Aprox. pedaços | Vetores brutos | OpenAI pequeno | OpenAI grande |
|---|---|---|---|---|---|---|
| 10.000 páginas | 6,65 milhões | 7,39 milhões | 14,778 | 0,08GB | $0.15 | $0.96 |
| 100.000 páginas | 66,5 milhões | 73,9 milhões | 147,778 | 0,85GB | $1.48 | $9.61 |
| 1 milhão de páginas | 665 milhões | 738,9 milhões | 1,48 milhão | 8,46GB | $14.78 | $96.06 |
| 10 milhões de páginas | 6,65B | 7.39B | 14,78 milhões | 84,56GB | $147.78 | $960.56 |
Para a linha de um milhão de páginas, Gemini Embedding a US$ 0,15 por milhão de tokens de entrada custaria cerca de US$ 110,83. Esses números mostram por que “incorporações são caras” pode ser uma suposição errada para texto. Na mesma escala, Cohere Parse lista o preço da API de US$ 1,50 por 1.000 páginas ou US$ 1.500 se todo um milhão de páginas for analisado. Uma melhor análise pode valer a pena – especialmente para tabelas, formulários, slides e PDFs complexos – mas deve ser modelada como seu próprio item de linha. Nosso Guia Cohere Parse v5 explica essa compensação com mais detalhes.
De quanto armazenamento vetorial você precisa?
Para vetores float32 densos, cada dimensão usa quatro bytes. Portanto, um vetor de 1.536 dimensões precisa de 6.144 bytes brutos — cerca de 6 KB — antes de qualquer índice ou metadados. Os 1,48 milhão de pedaços em nosso exemplo produzem cerca de 8,46 GiB de vetores brutos.
Orientação de planejamento de capacidade do Qdrant usa a mesma fórmula básica e estima separadamente links HNSW, cargas úteis, índices de carga útil, replicação e headroom. Essas adições explicam por que multiplicar vetores por dimensões é um piso, e não uma conta. Os índices de pesquisa aproximada podem ocupar uma memória substancial; texto armazenado e metadados ricos podem superar vetores compactados; as réplicas multiplicam os dados; e uma migração pode exigir dois índices completos de uma só vez.
A precisão é uma das maiores alavancas. Float16 corta bytes de vetor brutos aproximadamente pela metade; A quantização escalar de 8 bits pode reduzi-los aproximadamente quatro vezes; técnicas binárias e de quantização de produto podem ir além. Orientação de quantização também deixa clara a advertência essencial: a compressão troca precisão por economia de recursos. Meça o recall e a qualidade da classificação em seu próprio corpus antes de tratar uma taxa de compressão como dinheiro grátis.
Comparação de custos de banco de dados vetorial para RAG
Os preços dos bancos de dados vetoriais são mais difíceis de comparar do que os preços incorporados porque os fornecedores medem coisas diferentes: compromissos mínimos do plano, horas de computação, dimensões, unidades de leitura ou gravação, GiB armazenados, vCUs, dados transferidos ou combinações deles. A tabela a seguir é um mapa de planejamento – não uma referência normalizada.
| Provedor | Formato de preço público | Como funciona a vetorização | Melhor ajuste de custo/advertência |
|---|---|---|---|
| Pinecone | Iniciante grátis; Construtor $ 20/mês; O padrão tem um mínimo de US$ 50/mês; A empresa tem um mínimo de US$ 500/mês. O uso sem servidor adiciona armazenamento, leituras, gravações, importações e outros recursos. Um exemplo atual do AWS us-east-1 lista US$ 0,33/GB de armazenamento por mês e US$ 16 por milhão de unidades de leitura, com taxas de gravação variando de acordo com o plano. | Traga vetores ou use fluxos de trabalho integrados de incorporação e reclassificação; encargos e limites do modelo devem ser incluídos. | Baixas operações e uso elástico. As unidades de leitura dependem dos dados direcionados por uma consulta, portanto o design do namespace afeta o custo. |
| Recuperação de agente do Google | Armazenamento baseado em uso, leituras, gravações, ingestão de dados e unidades de capacidade. As taxas públicas incluem cerca de US$ 0,000410959/GiB-hora armazenada, US$ 0,06 por 100.000 leituras e US$ 0,18 por 100.000 gravações; as unidades de desempenho e capacidade de armazenamento são separadas. | Suporta incorporações automáticas, pesquisa híbrida e reclassificação semântica. O Google afirma que o modelo de incorporação Gemini selecionado é cobrado separadamente. | Atraente para um pipeline nativo do Google Cloud, mas “automático” não significa que a incorporação seja gratuita. |
| Hélios SingleStore | Nível Compartilhado Gratuito; O S-00 padrão começa em US$ 0,99/hora, aproximadamente US$ 723 para um mês de 730 horas, mais armazenamento. Os multiplicadores Multi-AZ e Enterprise aumentam a computação. | Armazena vetores junto com dados relacionais e oferece suporte à pesquisa de vetores. As funções de IA podem invocar modelos de SQL; verifique o status de visualização e modelo separado ou cobranças de inferência. | Forte quando cargas de trabalho transacionais, analíticas e vetoriais estão juntas. O piso de computação sempre ativo é alto para um pequeno projeto somente vetorial. |
| Supabase + pgvector | Gratuito inclui um banco de dados de 500 MB. O Pro custa US$ 25/mês e inclui US$ 10 em créditos de computação; o disco do banco de dados inclui 8 GB e lista US$ 0,125/GB. Calcule escalas de Micro para cima. | pgvector armazena e pesquisa vetores. Supabase documenta Edge Function e padrões de incorporação automática, incluindo modelos locais e APIs externas; o uso de incorporação externa é separado. | Excelente quando o aplicativo já usa Postgres, autenticação e segurança em nível de linha. A memória de índice e a computação do banco de dados – e não uma “taxa vetorial” especial – geralmente determinam a escala. |
| Nuvem Qdrant | Cluster grátis com 1 GB de RAM e 4 GB de disco; clusters pagos medem CPU, memória, disco, backups e inferência opcional de hora em hora. | Traga vetores ou use Qdrant Cloud Inference quando disponível. | Dimensionamento transparente de recursos e um caminho auto-hospedado de código aberto. Um cluster auto-hospedado de produção transfere as taxas da nuvem para o tempo da infraestrutura e do operador. |
| Nuvem Weaviate | Caixa de areia grátis; Flex começa em US$ 45/mês; O prêmio começa em US$ 400/mês. Flex lista medidores de dimensão vetorial, armazenamento e backup. | Traga vetores ou use módulos vetorizadores integrados; as cobranças de token do modelo hospedado podem ser separadas. | Útil quando a pesquisa híbrida e os modelos integrados reduzem o trabalho do aplicativo. O preço baseado em dimensão torna a contagem de blocos e o tamanho do vetor especialmente visíveis. |
| Nuvem Zilliz / Milvus | Serverless lista US$ 4 por milhão de vCUs mais armazenamento. Exemplos de fornecedores estimam cerca de US$ 6 para escrever um milhão de vetores de 1.536 dimensões e cerca de US$ 100 para um milhão de pesquisas em uma coleção de um milhão de vetores, antes de outros serviços. | Os embeddings normalmente vêm de um modelo externo ou gerenciado por aplicativo. | Entrada sem servidor com um caminho compatível com Milvus. Pesquise alterações de custo com tamanho da coleção, dimensões vetoriais, top-k, filtros e carga de trabalho. |
| Nuvem cromática | O Starter é baseado no uso com créditos; medidores públicos listam US$ 2,50/GiB gravados, US$ 0,33/GiB mês armazenado, US$ 0,0075/TiB consultado e US$ 0,09/GiB retornados. A equipe custa US$ 250/mês mais uso com créditos. | Pode trabalhar com vetores gerados por aplicativos e integrações incorporadas. | Medição simples e desenvolvimento rápido. As suposições de dados retornados e volume de consultas são importantes em escala. |
| Elastic Cloud sem servidor | Pesquisa, ingestão, VCUs de aprendizado de máquina, armazenamento e saída são medidos separadamente; os perfis vetoriais incluem uma permissão e a inferência começa com uma taxa por token. | Elastic oferece suporte a vetores densos e esparsos, além de endpoints de inferência e pesquisa híbrida. | Bom quando a pesquisa lexical, os filtros e a observabilidade justificam uma plataforma mais ampla. Conte a capacidade de ingestão e pesquisa, não apenas os GB armazenados. |
| Pesquisa de vetor do Atlas MongoDB | Custo do cluster Atlas mais nós de pesquisa ou recursos compartilhados. Um nó de pesquisa S20 é listado publicamente a partir de US$ 0,12/hora na AWS; implantações de pesquisa dedicada exigem pelo menos dois nós, fazendo com que o valor mínimo do nó de pesquisa seja de aproximadamente US$ 175/mês antes do cluster de banco de dados. | Armazene incorporações ao lado de documentos; integrações de aplicativos ou modelos os geram. | Ajuste arquitetônico econômico quando o Atlas já possui os dados JSON. Um projeto somente vetorial ainda deve pagar pela camada de banco de dados. |
| pgvector auto-hospedado | Nenhuma taxa de licença pgvector separada; pague por computação, memória, disco, réplicas, backups, rede e operações Postgres. Provedores Postgres gerenciados adicionam seus próprios medidores. | Gere embeddings no aplicativo, em uma função de banco de dados ou em um serviço conectado. | Freqüentemente, a escolha de menor complexidade para uma equipe Postgres existente. “Código aberto” não é o mesmo que custo total zero. |
Resumo de preços revisado em 2 de setembro de 2026. As tarifas podem variar de acordo com nuvem, região, plano, reserva, nível de suporte e acordo negociado. Siga cada página de preços vinculada e modele seu próprio padrão de consulta antes de comprar.
Para diferenças qualitativas de recuperação e implantação, use este guia junto com nossa comparação atualizada do principais bancos de dados de vetores para RAG.
Pinecone, Google, SingleStore e Supabase: como os modelos de custo diferem
Pinecone: medidores de uso mais um plano mínimo
Pinecone Serverless separa armazenamento, gravação e leitura. É documentação de custos explica que as unidades de leitura de consulta são dimensionadas de acordo com o tamanho do namespace alvo da pesquisa, com uma cobrança mínima por consulta. Isso torna o design de dados multilocatário uma decisão financeira: um namespace por locatário pode manter cada pesquisa com escopo para menos dados, enquanto um namespace compartilhado pode fazer com que uma consulta atinja uma coleção maior, mesmo quando os filtros de metadados retornam um pequeno conjunto de resultados.
Para planejamento, separe o plano mínimo mensal das operações de dados medidos. Em seguida, teste tamanhos realistas de namespace, top-k, reclassificação, upserts em lote e tráfego. Uma conta de armazenamento bruto baixa pode coexistir com uma conta de leitura maior em um volume alto de consultas.
Recuperação de agente do Google: vetorização automática, cobrada separadamente
O Google Agent Retrieval – anteriormente apresentado como Vector Search 2.0 – pode criar embeddings automaticamente e adicionar pesquisa híbrida e reclassificação semântica. A conveniência remove o código do pipeline, não a economia: Visão geral do Google diz que a incorporação automática usa a API Gemini, e a página de preços diz que o modelo de incorporação selecionado é cobrado separadamente.
Uma estimativa do Google deve, portanto, incluir pelo menos quatro camadas: tokens de incorporação Gemini, ingestão ou gravação de dados, GiB armazenados e unidades de capacidade e operações de leitura. Compare cuidadosamente este serviço baseado em uso mais recente com o padrão Vertex AI Vector Search; o produto mais antigo tem diferentes medidores de construção de índice, atualização de streaming e nó de serviço.
SingleStore: pesquisa vetorial dentro de uma plataforma de dados sempre ativa
SingleStore pode manter vetores, registros relacionais, campos de texto completo e análises em um sistema SQL distribuído. Essa consolidação pode remover trabalhos de sincronização e separar a infraestrutura. A desvantagem é que o tamanho da computação paga inicial é um espaço de trabalho de banco de dados sempre ativo, e não alguns dólares de armazenamento vetorial sem servidor.
Use o SingleStore quando a carga de trabalho combinada obtiver essa computação: dados operacionais, análises, pesquisa de texto completo e recuperação de vetores podem compartilhar uma plataforma. Se você precisar apenas de um pequeno índice de documentos, compare seu piso de computação S-00 mensal de aproximadamente US$ 723 com opções Postgres sem servidor ou existentes. Se as funções de IA chamarem um modelo de incorporação do SQL, confirme qual função está geralmente disponível e quem cobra a inferência.
Supabase: pgvector está incluído, a geração de incorporação é uma escolha separada
Supabase fornece ao Postgres a extensão pgvector, portanto, não há produto de banco de dados separado por vetor para comprar. A conta é moldada pelo plano Supabase, computação de banco de dados, disco, saída e qualquer serviço de incorporação que você chamar. A base de US$ 25 de um projeto Pro inclui créditos de computação, mas índices maiores ou consultas mais pesadas podem exigir mais memória e um tamanho de computação maior.
Supabase também publica padrões de incorporação automática usando gatilhos, filas, Edge Functions e um provedor de incorporação. Suas Edge Functions podem executar determinados modelos integrados, enquanto outros exemplos chamam OpenAI. Em ambos os casos, “automático” descreve a orquestração. O custo real depende do uso do Edge Function, dos recursos do banco de dados e de qualquer fatura de modelo externo.
Gerenciado versus auto-hospedado: o que é mais barato?
| Abordagem | Vantagens de custo | Custos que as pessoas perdem | Geralmente melhor quando |
|---|---|---|---|
| Gerenciado sem servidor | Pouca capacidade ociosa, configuração rápida, escalonamento automatizado, backups e atualizações incluídos ou disponíveis. | Planeje mínimos, unidades de leitura/gravação, saída, níveis de suporte, regiões premium e menos controle sobre o ajuste no nível do índice. | O tráfego é incerto ou a equipe tem pouca capacidade de operações de banco de dados. |
| Gerenciado dedicado | Capacidade e suporte previsíveis; redes privadas mais fáceis e objetivos de nível de serviço. | Nós ociosos, réplicas, tamanhos mínimos de cluster, superprovisionamento e compromissos de suporte. | O tráfego é sustentado e previsível ou a conformidade precisa de uma área dedicada. |
| Banco de dados existente com vetores | Reutiliza dados, permissões, backups, habilidades e contratos de fornecedores; menos caminhos de sincronização. | Os índices vetoriais competem com cargas de trabalho transacionais; atualizações de memória e réplicas de leitura podem ser caras. | Postgres, Elasticsearch, MongoDB ou SingleStore já possuem a fonte da verdade. |
| Mecanismo especializado auto-hospedado | Sem margem de serviço gerenciado; posicionamento máximo e controle de ajuste; portabilidade de código aberto. | Engenharia, plantão, atualizações, segurança, monitoramento, capacidade, backups, testes de restauração e risco de tempo de inatividade. | A escala é grande e estável, ou o controle de implantação é um requisito firme apoiado por uma equipe de operações. |
A auto-hospedagem só fica mais barata quando a infraestrutura e a mão de obra economizadas excedem o trabalho que você realiza. Um cluster de produção de dois ou três nós, backups, monitoramento, rede privada, resposta a incidentes e o tempo de um engenheiro podem sobrecarregar uma pequena conta gerenciada. Em cargas de trabalho constantes muito grandes, a auto-hospedagem bem executada pode se tornar econômica, mas esse cruzamento deve ser calculado com requisitos de mão de obra e confiabilidade totalmente carregados.
Como o custo muda do protótipo para a escala empresarial
Protótipo: comprove a qualidade da recuperação antes de comprar capacidade
Um protótipo com dezenas de milhares de páginas muitas vezes pode caber em níveis gratuitos ou em uma pequena instância Postgres existente. O custo de incorporação pode estar bem abaixo de um dólar. Gaste o escasso orçamento em uma amostra representativa de documentos, perguntas difíceis, testes de permissão e avaliação. Evite decisões de arquitetura baseadas na latência de uma pequena demonstração.
Produção: tráfego e confiabilidade substituem incorporação como principais variáveis
Em centenas de milhares a alguns milhões de páginas, os vetores brutos ainda podem caber em dezenas de GiB, mas com latência p95, usuários simultâneos, filtragem, atualização de ingestão e dimensionamento de unidade de alta disponibilidade. Unidades de leitura de consulta de modelo, memória de banco de dados, duas ou mais réplicas, backups e uma reindexação completa. Custo do instrumento por resposta fundamentada bem-sucedida – não apenas custo por consulta.
Empresa: governança e ciclo de vida dominam
Em dezenas de milhões de páginas ou limites rígidos de conformidade, segmentação de corpus, isolamento de locatário, rede privada, cópias regionais, objetivos de restauração, provas de exclusão, registros de auditoria, conjuntos de avaliação e capacidade de migração são importantes. Um acordo negociado pode tornar os preços públicos menos relevantes, mas não elimina a necessidade de uma economia unitária baseada na carga de trabalho.
Oito custos ocultos em um orçamento de vetorização
- Análise e OCR: PDFs complexos, digitalizações, tabelas e documentos com muitas imagens podem precisar de um analisador pago ou modelo de visão.
- Sobreposição e duplicatas de pedaços: texto repetido, clichê, versões e cópias aumentam tokens e vetores sem aumentar o conhecimento.
- Metadados e texto fonte: a carga útil em torno de um vetor de 6 KB pode ser maior que o vetor.
- Memória de índice e tempo de construção: Gráficos HNSW, índices de carga útil, compactação e recriações exigem espaço de trabalho e computação.
- Consultas, reclassificação e geração: incorporar uma consulta curta é barato; pesquisar grandes coleções, reclassificar dezenas de candidatos e gerar respostas longas pode ser uma tarefa recorrente.
- Replicação e recuperação: duas réplicas duplicam aproximadamente os dados vetoriais armazenados, enquanto os backups e as cópias entre regiões adicionam mais.
- Alterar captura e exclusão de dados: conectores, filas, novas tentativas, marcações para exclusão e sincronização de permissões exigem infraestrutura e engenharia.
- Reintegração e migração: um novo modelo ou chunker pode exigir um segundo índice completo durante o preenchimento, aumentando temporariamente os custos de armazenamento e gravação.
Os embeddings de consulta geralmente são triviais isoladamente. Um milhão de perguntas de 20 tokens equivalem a 20 milhões de tokens de entrada: cerca de US$ 0,40 com OpenAI text-embedding-3-small, US$ 2,60 com text-embedding-3-large ou US$ 3 com Gemini Embedding nas taxas acima. Leituras de banco de dados, reclassificação e geração de respostas provavelmente serão os maiores custos recorrentes.
Como reduzir o custo de vetorização sem prejudicar a qualidade do RAG
- Desduplicar antes de incorporar. Faça hash de pedaços normalizados e evite indexar versões idênticas de arquivos ou clichês.
- Escolha chunking com avaliação. Pedaços maiores reduzem a contagem de vetores, mas podem diluir a recuperação; sobreposição excessiva repete tokens. Sintonize ambos com questões reais.
- Use o menor modelo de incorporação eficaz. Compare Recall@k, nDCG, precisão de resposta downstream, latência, dimensões e preço – não apenas o tamanho do modelo.
- Reduza as dimensões deliberadamente. OpenAI e Voyage documentam dimensões flexíveis. Vetores menores economizam armazenamento e memória; valide a qualidade primeiro.
- Quantize depois de estabelecer uma linha de base. Vetores float16 ou de 8 bits podem cortar a memória, mas medem a recuperação antes e depois.
- Trabalhos off-line em lote. Google e Voyage publicam caminhos de lote com desconto. Use-os para compilações iniciais e preenchimentos não urgentes quando os limites de serviço permitirem.
- Incorporar de forma incremental. Mantenha IDs de blocos e hashes de conteúdo estáveis para que o conteúdo inalterado não seja reprocessado.
- Pesquisas de escopo. Partição por locatário ou corpus quando o preço de leitura do provedor depende dos dados digitalizados e impõe o mesmo limite para segurança.
- Armazene a fonte da verdade fora do índice. A ingestão reproduzível torna a migração e a reindexação do provedor mais seguras.
- Acompanhe o custo por resposta útil. Um índice mais barato e com baixa recuperação pode aumentar os custos de reclassificação, geração, suporte e novas tentativas do usuário.
Você deve construir a pilha de vetorização ou usar o RAG gerenciado?
Construa a pilha quando a recuperação fizer parte da vantagem do seu produto e você precisar de controle direto sobre análise, fragmentação, incorporação, índices, fusão, reclassificação, avaliação e posicionamento de dados. O esforço de engenharia pode ser justificado quando esses controles melhoram o resultado mensurável do produto.
Se o objetivo é permitir que funcionários ou clientes façam perguntas sobre o conhecimento aprovado da empresa, o gerenciamento de todas as camadas pode ser desnecessário. Um RAG como serviço ingestão de pacotes de produtos, recuperação, permissões, orquestração de modelos e uma experiência de assistente. Para implantações sensíveis à segurança, nosso guia para RAG em nuvens privadas abrange as decisões de limites mais amplas.
A comparação correta não é a assinatura de produtos gerenciados versus a incorporação de tokens. É uma assinatura gerenciada versus o custo total de um pipeline confiável: contas de fornecedores, infraestrutura, implementação, avaliação, manutenção e resposta a incidentes.
Uma lista de verificação prática do orçamento para vetorização
- Conte tokens de origem a partir de uma amostra representativa, em vez de depender apenas de páginas ou arquivos.
- Registre o tamanho e a sobreposição do bloco e calcule tokens repetidos.
- Defina o preço de pelo menos dois modelos de incorporação e suas dimensões de saída.
- Estime pedaços, bytes vetoriais brutos, metadados, texto de origem, sobrecarga de índice, espaço livre e réplicas.
- Inclua análise ou OCR por página, imagem ou token quando necessário.
- Modele gravações, exclusões, leituras, reclassificações, saídas e incorporações de consultas mensais.
- Capacidade de reserva para uma reindexação completa e uma transição de índice duplo.
- Inclua backups, testes de restauração, monitoramento, suporte e tempo de engenharia totalmente carregado.
- Execute o banco de dados selecionado em seu corpus e meça recall, latência, rendimento e custo juntos.
Perguntas frequentes
Quanto custa vetorizar um milhão de páginas?
De acordo com as suposições deste guia – 500 palavras por página, 1,33 tokens por palavra, blocos de 500 tokens e sobreposição de 50 tokens – um milhão de páginas produzem cerca de 738,9 milhões de tokens incorporados. Isso custa cerca de US$ 14,78 com OpenAI text-embedding-3-small, US$ 96,06 com text-embedding-3-large ou US$ 110,83 com Gemini Embedding a preços públicos on-line atuais. Análise opcional, armazenamento de banco de dados e índices, gravações, consultas, réplicas e mão de obra são adicionais. Cohere Parse acrescentaria US$ 1.500 se cada página fosse processada de acordo com a taxa de API listada.
O Google oferece vetorização automática?
Sim. O Google Agent Retrieval oferece suporte a incorporações automáticas em seu fluxo de trabalho de ingestão. A documentação do Google diz que ele usa a API Gemini e que o modelo de incorporação selecionado é cobrado separadamente. Você também paga os medidores relevantes de armazenamento, capacidade, leitura, gravação ou ingestão do Agent Retrieval.
Supabase inclui vetorização?
Supabase inclui Postgres e suporta pgvector para armazenamento e pesquisa de similaridade. Ele documenta pipelines de incorporação automática e modelos de Edge Function, mas o plano de banco de dados não é uma permissão geral de token de incorporação. Inclua o uso do Edge Function, cobranças de API de incorporação externa, quando aplicável, e a computação do banco de dados e o disco necessários para o índice.
O SingleStore pode criar embeddings?
SingleStore oferece suporte a dados vetoriais e pesquisa, e suas funções de IA podem chamar modelos de incorporação de SQL em configurações suportadas. Trate a computação do banco de dados e a inferência de modelo como itens de linha separados e verifique a disponibilidade e o faturamento da função e do provedor exatos que você planeja usar.
Quanto custa Pinecone por RAG?
Pinecone tem um plano Starter gratuito, um plano Builder de US$ 20 por mês, um mínimo mensal de US$ 50 para Standard e um mínimo de US$ 500 para Enterprise no momento da revisão. O uso sem servidor adiciona armazenamento, gravações, leituras, importações, reclassificação e outros recursos selecionados. Como as unidades de leitura dependem dos dados direcionados por uma consulta, faça uma estimativa com o tamanho e o tráfego do seu namespace, em vez de usar apenas o armazenamento.
De quanto armazenamento um milhão de vetores precisa?
Um milhão de vetores float32 de 1.536 dimensões precisam de cerca de 5,72 GiB de dados vetoriais brutos. Isso exclui IDs, metadados, texto fonte, índice de pesquisa aproximada, réplicas, backups e espaço livre. Float16 ou quantização podem reduzir a porção do vetor, enquanto dimensões e réplicas maiores a aumentam.
Você só precisa vetorizar um banco de dados uma vez?
Não. O conteúdo novo e alterado deve ser incorporado, as exclusões devem chegar ao índice e um novo modelo de incorporação ou estratégia de agrupamento pode exigir uma reconstrução completa. Armazene hashes de conteúdo, IDs de blocos estáveis e versões de modelo e de blocos para que você possa atualizar de forma incremental e auditar o que mudou.
Qual é o banco de dados vetorial mais barato para RAG?
A opção mais barata geralmente é o banco de dados capaz que você já opera: pgvector em uma implantação Postgres existente, Vector Search em um cluster MongoDB existente ou Elasticsearch quando a pesquisa já faz parte da pilha. Para uma nova carga de trabalho pequena, as camadas gratuitas e sem servidor podem ser mais baratas. Para uma grande carga de trabalho constante, a capacidade dedicada ou auto-hospedada pode ser a vencedora. Compare o custo total com a mesma meta de recall, latência, disponibilidade e segurança.
O resultado final
Os preços de incorporação de texto caíram o suficiente para que a vetorização do corpus inicial possa ser surpreendentemente barata. O exemplo de um milhão de páginas neste guia custa de dezenas a pouco mais de cem dólares para incorporações – não milhares. O sistema RAG total ainda pode se tornar caro porque a análise, o atendimento do banco de dados, o volume de consultas, a alta disponibilidade, a reclassificação, a geração e as operações ocorrem muito depois da gravação do primeiro vetor.
Crie sua estimativa a partir de tokens e pedaços medidos, mantenha todas as suposições visíveis e compare fornecedores usando uma carga de trabalho. Se o seu objetivo é um assistente de conhecimento útil para a empresa, em vez de uma plataforma de recuperação personalizada, construir um assistente Cody e testar questões reais antes de se comprometer com um projeto de infraestrutura de grande porte.


