Gemini 3.1 Flash Live Preview
Modelo de visualização de áudio para áudio do Google para diálogo de baixa latência com consciência multimodal, pensamento, base de pesquisa e chamada de função.
Modelo de visualização de áudio para áudio do Google para diálogo de baixa latência com consciência multimodal, pensamento, base de pesquisa e chamada de função.
Visão geral em inglês simples
Gemini 3.1 Flash Live aceita áudio ao vivo junto com texto, imagens e vídeo e, em seguida, retorna texto e áudio. Destina-se a conversas que se beneficiam de nuances acústicas e contexto visual, em vez da simples reprodução de texto para fala.
Google publica taxas de token e equivalentes de áudio por minuto. Isso facilita o orçamento antecipado, mas a base de pesquisa e as entradas multimodais ainda podem adicionar uso separado.
Comparação de categorias
Estas são especificações publicadas pelo fornecedor, não pontuações de benchmark Cody. Siga as fontes vinculadas para limites atuais e exceções específicas de endpoint.
Acesso à API e ao provedor
Disponibilidade
Visualize o acesso por meio da API Gemini Live e Google AI Studio nas regiões suportadas.
Use a lista de regiões Gemini API ao vivo do Google e confirme a elegibilidade para visualização.
Verifique a disponibilidade ao vivoDados e treinamento
Google afirma que o conteúdo pago do Gemini API não é usado para melhorar seus produtos; dados de serviços não pagos geralmente podem ser. Confirme o status do faturamento e os termos atuais antes de enviar conversas confidenciais.
Esta é uma leitura concisa do material citado do fornecedor, e não um aconselhamento jurídico. Um gateway de terceiros pode ter diferentes termos de armazenamento, roteamento, treinamento e residência da API direta do criador do modelo.
Leia a política do provedorPerguntas frequentes
Modelo de visualização de áudio para áudio do Google para diálogo de baixa latência com consciência multimodal, pensamento, base de pesquisa e chamada de função. Gemini 3.1 Flash Live aceita áudio ao vivo junto com texto, imagens e vídeo e, em seguida, retorna texto e áudio. Destina-se a conversas que se beneficiam de nuances acústicas e contexto visual, em vez da simples reprodução de texto para fala.
Gemini 3.1 Flash Live Preview foi lançado em 1 de março de 2026 de acordo com os materiais do fornecedor citado.
Visualize o acesso por meio da API Gemini Live e Google AI Studio nas regiões suportadas. As rotas de acesso listadas neste guia são Google.
Entrada de áudio de US$ 0,005/min · Saída de áudio de US$ 0,018/min. Equivalentes de nível pago do Google; a entrada/saída de texto custa US$ 0,75/US$ 4,50 por milhão de tokens e a entrada de imagem/vídeo equivale a US$ 0,002 por minuto.
Visualize o acesso por meio da API Gemini Live e Google AI Studio nas regiões suportadas. Use a lista de regiões Gemini API ao vivo do Google e confirme a elegibilidade para visualização.
Google afirma que o conteúdo pago do Gemini API não é usado para melhorar seus produtos; dados de serviços não pagos geralmente podem ser. Confirme o status do faturamento e os termos atuais antes de enviar conversas confidenciais. A política pertence à rota do provedor e aos termos da conta, portanto, verifique-a novamente antes do uso em produção.
Comparações relacionadas
Modelo de raciocínio de fala para fala em tempo real do OpenAI para agentes de voz que usam ferramentas e que também precisam de contexto de texto e imagem.
Abrir comparação completaModelo expressivo de conversão de texto em fala em tempo real do ElevenLabs para diálogo natural, entrega emocional, tags de áudio e mais de 70 idiomas.
Abrir comparação completaO mais novo modelo expressivo de conversão de texto em fala em tempo real da Inworld, projetado para lembrar a conversação e falar em mais de 100 idiomas.
Abrir comparação completaModelo atual de fala em fala em tempo real do SpaceXAI para agentes de conversação em menos de um segundo com acesso a ferramentas.
Abrir comparação completa