Gemini 3.8 Live
Le modèle vocal en temps réel de Google pour des échanges réactifs avec audio, texte et contexte visuel.
Le modèle vocal en temps réel de Google pour des échanges réactifs avec audio, texte et contexte visuel.
Présentation de l'anglais simple
Gemini 3.8 Live peut échanger sur ce que l’utilisateur dit ou montre à la caméra et appeler des outils pendant la conversation. Contrairement à Gemini 3.8 Flash, qui renvoie du texte, Live est conçu pour les échanges oraux.
Choisissez cette version pour les assistants vocaux du quotidien. Son raisonnement s’insère dans la conversation, sans niveau de réflexion réglable. Extended Thinking est un modèle distinct pour les tâches plus complexes.
Comparaison des catégories
Il s'agit de spécifications publiées par le fournisseur et non de scores de référence Cody. Suivez les sources liées pour connaître les limites actuelles et les exceptions spécifiques aux points de terminaison.
Accès API et fournisseur
Disponibilité
Disponible via Gemini Live API et Google AI Studio dans les régions prises en charge.
Utilisez la liste des régions disponibles en direct de Google et vérifiez les restrictions de fonctionnalités pour l'itinéraire sélectionné.
Vérifier la disponibilité en directDonnées et formation
Google indique que les invites et réponses Gemini API payantes ne sont pas utilisées pour améliorer ses produits. Le contenu des services non payants peut généralement être utilisé, avec un traitement différent pour les utilisateurs de l'EEE, du Royaume-Uni et de la Suisse ; vérifiez les conditions actuelles de votre compte et de votre région.
Il s'agit d'une lecture concise du matériel du fournisseur cité, et non d'un avis juridique. Une passerelle tierce peut avoir des conditions de stockage, de routage, de formation et de résidence différentes de celles de l'API directe du modéliste.
Lire la politique du fournisseurQuestions fréquemment posées
Le modèle vocal en temps réel de Google pour des échanges réactifs avec audio, texte et contexte visuel. Gemini 3.8 Live peut échanger sur ce que l’utilisateur dit ou montre à la caméra et appeler des outils pendant la conversation. Contrairement à Gemini 3.8 Flash, qui renvoie du texte, Live est conçu pour les échanges oraux.
Gemini 3.8 Live a été publié sur 15 septembre 2026 selon les documents du fournisseur cités.
Disponible via Gemini Live API et Google AI Studio dans les régions prises en charge. Les voies d'accès répertoriées dans ce guide sont Google.
Entrée audio à 0,005 $/min · Sortie audio à 0,018 $/min. Tarifs payants : 3 USD en entrée audio et 12 USD en sortie par million de tokens. Le texte coûte 0,75 USD en entrée et 4,50 USD en sortie ; les images/vidéos coûtent 1 USD en entrée par million de tokens. Le raisonnement et les recherches payantes peuvent ajouter des frais.
Disponible via Gemini Live API et Google AI Studio dans les régions prises en charge. Utilisez la liste des régions disponibles en direct de Google et vérifiez les restrictions de fonctionnalités pour l'itinéraire sélectionné.
Google indique que les invites et réponses Gemini API payantes ne sont pas utilisées pour améliorer ses produits. Le contenu des services non payants peut généralement être utilisé, avec un traitement différent pour les utilisateurs de l'EEE, du Royaume-Uni et de la Suisse ; vérifiez les conditions actuelles de votre compte et de votre région. La politique appartient à l'itinéraire du fournisseur et aux conditions du compte, vérifiez-la donc à nouveau avant de l'utiliser en production.
Comparaisons associées
Frontend vocal full duplex du OpenAI pour une conversation naturelle qui délègue un raisonnement et des actions plus approfondis à un agent backend distinct.
Ouvrir la comparaison complèteUn modèle vocal Gemini distinct qui traite les demandes complexes en arrière-plan tout en poursuivant la conversation.
Ouvrir la comparaison complèteModèle de raisonnement parole-parole en temps réel de OpenAI pour les agents vocaux utilisant des outils qui ont également besoin d'un contexte de texte et d'image.
Ouvrir la comparaison complèteModèle audio-audio en avant-première de Google pour un dialogue à faible latence avec une conscience multimodale, une réflexion, une mise à la terre de recherche et un appel de fonction.
Ouvrir la comparaison complèteModèle de synthèse vocale en temps réel expressif de ElevenLabs pour un dialogue naturel, une transmission émotionnelle, des balises audio et plus de 70 langues.
Ouvrir la comparaison complèteLe tout nouveau modèle expressif de synthèse vocale en temps réel d'Inworld, conçu pour mémoriser les conversations et parler dans plus de 100 langues.
Ouvrir la comparaison complèteModèle de parole en temps réel actuel de SpaceXAI pour les agents conversationnels en moins d'une seconde avec accès aux outils.
Ouvrir la comparaison complète