Gemini 3.1 Flash Live Preview
Modelo de vista previa de audio a audio de Google para diálogos de baja latencia con conciencia, pensamiento, base de búsqueda y llamadas de funciones multimodales.
Modelo de vista previa de audio a audio de Google para diálogos de baja latencia con conciencia, pensamiento, base de búsqueda y llamadas de funciones multimodales.
Descripción general en inglés sencillo
Gemini 3.1 Flash Live acepta audio en vivo junto con texto, imágenes y video, luego devuelve texto y audio. Está dirigido a conversaciones que se benefician de los matices acústicos y el contexto visual en lugar de la simple reproducción de texto a voz.
Google publica tarifas simbólicas y equivalentes de audio por minuto. Esto facilita la elaboración temprana de presupuestos, pero la base de búsqueda y las entradas multimodales aún pueden agregar un uso separado.
Comparación de categorías
Estas son especificaciones publicadas por el proveedor, no puntuaciones de referencia Cody. Siga las fuentes vinculadas para conocer los límites actuales y las excepciones específicas de los terminales.
Acceso a API y proveedores
Disponibilidad
Obtenga una vista previa del acceso a través de Gemini Live API y Google AI Studio en las regiones admitidas.
Utilice la lista de regiones Gemini API en vivo de Google y confirme la elegibilidad para la vista previa.
Consultar disponibilidad en vivoDatos y entrenamiento
Google dice que el contenido pago Gemini API no se utiliza para mejorar sus productos; los datos de servicios no pagados generalmente pueden serlo. Confirme el estado de facturación y los términos actuales antes de enviar conversaciones confidenciales.
Esta es una lectura concisa del material del proveedor citado, no un asesoramiento legal. Una puerta de enlace de terceros puede tener términos de almacenamiento, enrutamiento, capacitación y residencia diferentes a los de la API directa del fabricante del modelo.
Lea la política del proveedor.Preguntas frecuentes
Modelo de vista previa de audio a audio de Google para diálogos de baja latencia con conciencia, pensamiento, base de búsqueda y llamadas de funciones multimodales. Gemini 3.1 Flash Live acepta audio en vivo junto con texto, imágenes y video, luego devuelve texto y audio. Está dirigido a conversaciones que se benefician de los matices acústicos y el contexto visual en lugar de la simple reproducción de texto a voz.
Gemini 3.1 Flash Live Preview se lanzó en 1 de marzo de 2026 según los materiales del proveedor citados.
Obtenga una vista previa del acceso a través de Gemini Live API y Google AI Studio en las regiones admitidas. Las rutas de acceso enumeradas en esta guía son Google.
$0.005/min entrada de audio · $0.018/min salida de audio. equivalentes de nivel pago de Google; La entrada/salida de texto cuesta $0,75/$4,50 por millón de tokens y la entrada de imágenes/vídeo cuesta $0,002 por minuto equivalente.
Obtenga una vista previa del acceso a través de Gemini Live API y Google AI Studio en las regiones admitidas. Utilice la lista de regiones Gemini API en vivo de Google y confirme la elegibilidad para la vista previa.
Google dice que el contenido pago Gemini API no se utiliza para mejorar sus productos; los datos de servicios no pagados generalmente pueden serlo. Confirme el estado de facturación y los términos actuales antes de enviar conversaciones confidenciales. La política pertenece a la ruta del proveedor y a los términos de la cuenta, así que verifíquela nuevamente antes de usarla en producción.
Comparaciones relacionadas
Modelo de razonamiento de voz a voz en tiempo real de OpenAI para agentes de voz que utilizan herramientas que también necesitan contexto de texto e imagen.
Abrir comparación completaModelo expresivo de conversión de texto a voz en tiempo real ElevenLabs para diálogo natural, entrega emocional, etiquetas de audio y más de 70 idiomas.
Abrir comparación completaEl modelo expresivo de conversión de texto a voz en tiempo real más nuevo de Inworld, diseñado para recordar la entrega conversacional y hablar en más de 100 idiomas.
Abrir comparación completaModelo actual de voz a voz en tiempo real de SpaceXAI para agentes conversacionales en menos de un segundo con acceso a herramientas.
Abrir comparación completa