Gemini 3.8 Live
El modelo de voz en tiempo real de Google para conversaciones fluidas con audio, texto y contexto visual.
El modelo de voz en tiempo real de Google para conversaciones fluidas con audio, texto y contexto visual.
Descripción general en inglés sencillo
Gemini 3.8 Live puede conversar sobre lo que el usuario dice o muestra en cámara y utilizar herramientas durante la conversación. A diferencia de Gemini 3.8 Flash, que devuelve texto, Live está diseñado para la interacción hablada.
Elige esta versión para asistentes de voz de uso cotidiano. Su razonamiento se intercala con la conversación, sin un nivel de pensamiento ajustable. Extended Thinking es un modelo independiente para tareas más complejas.
Comparación de categorías
Estas son especificaciones publicadas por el proveedor, no puntuaciones de referencia Cody. Siga las fuentes vinculadas para conocer los límites actuales y las excepciones específicas de los terminales.
Acceso a API y proveedores
Disponibilidad
Disponible mediante Gemini Live API y Google AI Studio en las regiones admitidas.
Utilice la lista en vivo de regiones disponibles de Google y verifique las restricciones de funciones para la ruta seleccionada.
Consultar disponibilidad en vivoDatos y entrenamiento
Google dice que las indicaciones y respuestas pagadas de Gemini API no se utilizan para mejorar sus productos. Por lo general, se puede utilizar contenido de servicios no pagos, con un tratamiento diferente para los usuarios del EEE, el Reino Unido y Suiza; verifique los términos actuales para su cuenta y región.
Esta es una lectura concisa del material del proveedor citado, no un asesoramiento legal. Una puerta de enlace de terceros puede tener términos de almacenamiento, enrutamiento, capacitación y residencia diferentes a los de la API directa del fabricante del modelo.
Lea la política del proveedor.Preguntas frecuentes
El modelo de voz en tiempo real de Google para conversaciones fluidas con audio, texto y contexto visual. Gemini 3.8 Live puede conversar sobre lo que el usuario dice o muestra en cámara y utilizar herramientas durante la conversación. A diferencia de Gemini 3.8 Flash, que devuelve texto, Live está diseñado para la interacción hablada.
Gemini 3.8 Live se lanzó en 15 de septiembre de 2026 según los materiales del proveedor citados.
Disponible mediante Gemini Live API y Google AI Studio en las regiones admitidas. Las rutas de acceso enumeradas en esta guía son Google.
$0.005/min entrada de audio · $0.018/min salida de audio. Tarifas del nivel de pago: 3 USD de entrada de audio y 12 USD de salida por millón de tokens. El texto cuesta 0,75 USD de entrada y 4,50 USD de salida; la entrada de imagen/vídeo, 1 USD por millón de tokens. El razonamiento y la búsqueda de pago pueden añadir costes.
Disponible mediante Gemini Live API y Google AI Studio en las regiones admitidas. Utilice la lista en vivo de regiones disponibles de Google y verifique las restricciones de funciones para la ruta seleccionada.
Google dice que las indicaciones y respuestas pagadas de Gemini API no se utilizan para mejorar sus productos. Por lo general, se puede utilizar contenido de servicios no pagos, con un tratamiento diferente para los usuarios del EEE, el Reino Unido y Suiza; verifique los términos actuales para su cuenta y región. La política pertenece a la ruta del proveedor y a los términos de la cuenta, así que verifíquela nuevamente antes de usarla en producción.
Comparaciones relacionadas
La interfaz de voz full-duplex de OpenAI para una conversación natural que delega razonamientos y acciones más profundos a un agente de backend independiente.
Abrir comparación completaUn modelo de voz Gemini independiente que resuelve solicitudes complejas en segundo plano mientras mantiene la conversación.
Abrir comparación completaModelo de razonamiento de voz a voz en tiempo real de OpenAI para agentes de voz que utilizan herramientas que también necesitan contexto de texto e imagen.
Abrir comparación completaModelo de vista previa de audio a audio de Google para diálogos de baja latencia con conciencia, pensamiento, base de búsqueda y llamadas de funciones multimodales.
Abrir comparación completaModelo expresivo de conversión de texto a voz en tiempo real ElevenLabs para diálogo natural, entrega emocional, etiquetas de audio y más de 70 idiomas.
Abrir comparación completaEl modelo expresivo de conversión de texto a voz en tiempo real más nuevo de Inworld, diseñado para recordar la entrega conversacional y hablar en más de 100 idiomas.
Abrir comparación completaModelo actual de voz a voz en tiempo real de SpaceXAI para agentes conversacionales en menos de un segundo con acceso a herramientas.
Abrir comparación completa