Veo 3.1
Modelo de vídeo de visualização do Google para geração guiada por texto, imagem e vídeo com áudio nativo e opções de saída de até 4K.
Modelo de vídeo de visualização do Google para geração guiada por texto, imagem e vídeo com áudio nativo e opções de saída de até 4K.
Visão geral em inglês simples
Veo 3.1 lida com clipes curtos com áudio sincronizado e suporta geração, extensão, interpolação e fluxos de trabalho orientados por referência por meio de endpoints específicos de variantes. Resolução, duração e modo de entrada estão vinculados; nem todas as combinações estão disponíveis.
Google publica um intervalo de latência de solicitação incomumente útil de 11 segundos a seis minutos durante períodos de pico. Essa é uma faixa operacional, não uma referência de qualidade, e uma resolução mais alta pode aumentar a latência e o preço.
Comparação de categorias
Estas são especificações publicadas pelo fornecedor, não pontuações de benchmark Cody. Siga as fontes vinculadas para limites atuais e exceções específicas de endpoint.
Preços e comparações
Defina seu uso. A estimativa é atualizada enquanto você digita.
Exemplo: clipes de 8 segundos em 720p com áudio. Modelos incompatíveis com essas configurações não recebem estimativa.
Veo 3.1
Total estimado (USD)
Para o uso indicado · USD · Preço de API, não de assinatura
Estimativas sem impostos, ferramentas, armazenamento/gravação de cache, franquias gratuitas e descontos personalizados. Imagens incluem apenas a saída, sem prompt ou referências. Os modos de qualidade variam. Configurações não listadas não são consideradas gratuitas.
Acesso à API e ao provedor
Disponibilidade
Pré-visualização do acesso através de Gemini API; variantes também estão disponíveis em plataformas selecionadas.
Google publica restrições regionais de geração de pessoas para locais da UE, Reino Unido, Suíça e MENA.
Verifique a disponibilidade ao vivoDados e treinamento
Google afirma que o conteúdo pago do Gemini API não é usado para melhorar seus produtos. Os vídeos gerados ficam retidos no servidor por dois dias e devem ser baixados durante esse período.
Esta é uma leitura concisa do material citado do fornecedor, e não um aconselhamento jurídico. Um gateway de terceiros pode ter diferentes termos de armazenamento, roteamento, treinamento e residência da API direta do criador do modelo.
Leia a política do provedorPerguntas frequentes
Modelo de vídeo de visualização do Google para geração guiada por texto, imagem e vídeo com áudio nativo e opções de saída de até 4K. Veo 3.1 lida com clipes curtos com áudio sincronizado e suporta geração, extensão, interpolação e fluxos de trabalho orientados por referência por meio de endpoints específicos de variantes. Resolução, duração e modo de entrada estão vinculados; nem todas as combinações estão disponíveis.
Veo 3.1 foi lançado em 1 de setembro de 2025 de acordo com os materiais do fornecedor citado.
Pré-visualização do acesso através de Gemini API; variantes também estão disponíveis em plataformas selecionadas. As rotas de acesso listadas neste guia são Google, fal e Runway.
US$ 0,40/segundo em 720p ou 1080p. A saída padrão com áudio custa US$ 0,40/s em 720p ou 1080p e US$ 0,60/s em 4K. As variantes Fast e Lite têm taxas diferentes.
Pré-visualização do acesso através de Gemini API; variantes também estão disponíveis em plataformas selecionadas. Google publica restrições regionais de geração de pessoas para locais da UE, Reino Unido, Suíça e MENA.
Google afirma que o conteúdo pago do Gemini API não é usado para melhorar seus produtos. Os vídeos gerados ficam retidos no servidor por dois dias e devem ser baixados durante esse período. A política pertence à rota do provedor e aos termos da conta, portanto, verifique-a novamente antes do uso em produção.
Comparações relacionadas
Modelo legado de áudio e vídeo sincronizado do OpenAI para clipes curtos guiados por texto ou imagem - ainda documentado, mas próximo de um desligamento permanente da API.
Abrir comparação completaVariante Veo 3.1 de baixo custo do Google para criar rapidamente clipes de vídeo curtos com áudio nativo e opções de saída de até 4K.
Abrir comparação completaO principal modelo de vídeo de desenvolvedor do Runway para clipes guiados por texto e imagem, com formatos profissionais e uma taxa básica de crédito por segundo previsível.
Abrir comparação completaModelo de vídeo Pro do Kuaishou fornecido por meio do fal para geração de texto/imagem multi-shot, áudio nativo opcional, referências e clipes de até 15 segundos.
Abrir comparação completaUm modelo Kling econômico no fal para clipes fluidos de cinco ou dez segundos gerados a partir de texto ou imagem inicial.
Abrir comparação completaModelo de vídeo atual do SpaceXAI para transformar texto, imagens ou referências em clipes curtos com fala e som gerados opcionais.
Abrir comparação completaO modelo audiovisual atual da ByteDance para clipes coerentes de até 30 segundos, com som nativo, narrativa longa, referências ricas e edição direcionada.
Abrir comparação completaFamília de vídeo unificada do Alibaba para criar clipes curtos com som de texto, uma imagem inicial ou um vídeo de referência.
Abrir comparação completaModelo de vídeo com foco na qualidade Lightricks para criar clipes de 720p ou 1080p a partir de texto, imagens ou áudio com som nativo.
Abrir comparação completaModelo de vídeo com velocidade otimizada do LTX para entrada de texto, imagem ou áudio, som nativo, duração automática e saída de até 4K.
Abrir comparação completaModelo de vídeo de fluxo de trabalho completo maduro do LTX para geração, além de Retake, Extend, Reframe, áudio nativo e controle do primeiro ao último quadro.
Abrir comparação completa