Gemini 3.8 Live
O modelo de voz em tempo real do Google para conversas ágeis com áudio, texto e contexto visual.
O modelo de voz em tempo real do Google para conversas ágeis com áudio, texto e contexto visual.
Visão geral em inglês simples
O Gemini 3.8 Live pode conversar sobre o que o usuário diz ou mostra na câmera e chamar ferramentas durante a conversa. Ao contrário do Gemini 3.8 Flash, que retorna texto, o Live foi feito para interação por voz.
Escolha esta versão para assistentes de voz do dia a dia. O raciocínio é intercalado com a conversa, sem nível de pensamento ajustável. Extended Thinking é um modelo separado para tarefas mais complexas.
Comparação de categorias
Estas são especificações publicadas pelo fornecedor, não pontuações de benchmark Cody. Siga as fontes vinculadas para limites atuais e exceções específicas de endpoint.
Acesso à API e ao provedor
Disponibilidade
Disponível pela Gemini Live API e pelo Google AI Studio nas regiões atendidas.
Use a lista de regiões disponíveis ao vivo do Google e verifique as restrições de recursos para a rota selecionada.
Verifique a disponibilidade ao vivoDados e treinamento
Google afirma que os prompts e respostas pagos do Gemini API não são usados para melhorar seus produtos. Geralmente, conteúdo de serviço não pago pode ser usado, com tratamento diferente para usuários do EEE, do Reino Unido e da Suíça; verifique os termos atuais para sua conta e região.
Esta é uma leitura concisa do material citado do fornecedor, e não um aconselhamento jurídico. Um gateway de terceiros pode ter diferentes termos de armazenamento, roteamento, treinamento e residência da API direta do criador do modelo.
Leia a política do provedorPerguntas frequentes
O modelo de voz em tempo real do Google para conversas ágeis com áudio, texto e contexto visual. O Gemini 3.8 Live pode conversar sobre o que o usuário diz ou mostra na câmera e chamar ferramentas durante a conversa. Ao contrário do Gemini 3.8 Flash, que retorna texto, o Live foi feito para interação por voz.
Gemini 3.8 Live foi lançado em 15 de setembro de 2026 de acordo com os materiais do fornecedor citado.
Disponível pela Gemini Live API e pelo Google AI Studio nas regiões atendidas. As rotas de acesso listadas neste guia são Google.
Entrada de áudio de US$ 0,005/min · Saída de áudio de US$ 0,018/min. Tarifas pagas: US$ 3 para entrada de áudio e US$ 12 para saída por milhão de tokens. Texto custa US$ 0,75 na entrada e US$ 4,50 na saída; entrada de imagem/vídeo custa US$ 1 por milhão de tokens. Raciocínio e pesquisas pagas podem gerar custos extras.
Disponível pela Gemini Live API e pelo Google AI Studio nas regiões atendidas. Use a lista de regiões disponíveis ao vivo do Google e verifique as restrições de recursos para a rota selecionada.
Google afirma que os prompts e respostas pagos do Gemini API não são usados para melhorar seus produtos. Geralmente, conteúdo de serviço não pago pode ser usado, com tratamento diferente para usuários do EEE, do Reino Unido e da Suíça; verifique os termos atuais para sua conta e região. A política pertence à rota do provedor e aos termos da conta, portanto, verifique-a novamente antes do uso em produção.
Comparações relacionadas
Front-end de voz full-duplex do OpenAI para conversas naturais que delega raciocínios e ações mais profundos a um agente de back-end separado.
Abrir comparação completaUm modelo de voz Gemini separado que resolve solicitações complexas em segundo plano enquanto mantém a conversa.
Abrir comparação completaModelo de raciocínio de fala para fala em tempo real do OpenAI para agentes de voz que usam ferramentas e que também precisam de contexto de texto e imagem.
Abrir comparação completaModelo de visualização de áudio para áudio do Google para diálogo de baixa latência com consciência multimodal, pensamento, base de pesquisa e chamada de função.
Abrir comparação completaModelo expressivo de conversão de texto em fala em tempo real do ElevenLabs para diálogo natural, entrega emocional, tags de áudio e mais de 70 idiomas.
Abrir comparação completaO mais novo modelo expressivo de conversão de texto em fala em tempo real da Inworld, projetado para lembrar a conversação e falar em mais de 100 idiomas.
Abrir comparação completaModelo atual de fala em fala em tempo real do SpaceXAI para agentes de conversação em menos de um segundo com acesso a ferramentas.
Abrir comparação completa