Tous les modèles
Google

Gemini 3.1 Flash Live Preview

Modèle audio-audio en avant-première de Google pour un dialogue à faible latence avec une conscience multimodale, une réflexion, une mise à la terre de recherche et un appel de fonction.

Présentation de l'anglais simple

Qu'est-ce que Gemini 3.1 Flash Live Preview ?

Gemini 3.1 Flash Live accepte l'audio en direct aux côtés du texte, des images et de la vidéo, puis renvoie le texte et l'audio. Il est destiné aux conversations qui bénéficient de nuances acoustiques et d’un contexte visuel plutôt que d’une simple lecture de synthèse vocale.

Google publie à la fois les tarifs des jetons et les équivalents audio par minute. Cela facilite la budgétisation précoce, mais l'ancrage de la recherche et les entrées multimodales peuvent toujours ajouter une utilisation distincte.

Bon ajustement pour

  • Assistants vocaux multimodaux
  • Expériences en direct basées sur la recherche Google
  • Expérimentation audio à faible coût

Comparaison des catégories

Les faits importants pour les modèles voix

Il s'agit de spécifications publiées par le fournisseur et non de scores de référence Cody. Suivez les sources liées pour connaître les limites actuelles et les exceptions spécifiques aux points de terminaison.

Base de prix
Audio 0,005 $/min en entrée · 0,018 $/min en sortiePrix basé sur un jeton, un caractère ou une minute pour l'itinéraire d'accès répertorié.
Mode d'interaction
Entrée audio-audio multimodale en temps réelComportement parole-parole, audio-audio ou synthèse vocale en streaming.
Latence publiée
Non publiéMesure publiée par le fournisseur avec ses exclusions indiquées ; pas un test Cody.
Langues
Multilingue ; vérifier la prise en charge actuelle de l'API LiveCouverture linguistique documentée par le fournisseur ou marqueur clair non publié.
Outils et contrôle
Appel de fonction et mise à la terre de rechercheFonctionnalités natives d’appel de fonctions, de raisonnement ou de contrôle vocal.
Contexte ou limite d'entrée
131 072 entrées · 65 536 sortiesLimite de jetons ou de caractères documentée lorsque cela est significatif.

Accès API et fournisseur

Où obtenir Gemini 3.1 Flash Live Preview

Disponibilité

Régions et étape d'accès

Accès en aperçu via l'API Gemini Live et Google AI Studio dans les régions prises en charge.

Utilisez la liste de régions Gemini API en direct de Google et confirmez l’éligibilité à l’aperçu.

Vérifier la disponibilité en direct

Données et formation

L'itinéraire compte.

Google indique que le contenu Gemini API payant n'est pas utilisé pour améliorer ses produits ; les données de service non rémunérées peuvent généralement l'être. Confirmez l'état de facturation et les conditions actuelles avant d'envoyer des conversations sensibles.

Il s'agit d'une lecture concise du matériel du fournisseur cité, et non d'un avis juridique. Une passerelle tierce peut avoir des conditions de stockage, de routage, de formation et de résidence différentes de celles de l'API directe du modéliste.

Lire la politique du fournisseur

Questions fréquemment posées

FAQ Gemini 3.1 Flash Live Preview

Qu'est-ce que Gemini 3.1 Flash Live Preview ?

Modèle audio-audio en avant-première de Google pour un dialogue à faible latence avec une conscience multimodale, une réflexion, une mise à la terre de recherche et un appel de fonction. Gemini 3.1 Flash Live accepte l'audio en direct aux côtés du texte, des images et de la vidéo, puis renvoie le texte et l'audio. Il est destiné aux conversations qui bénéficient de nuances acoustiques et d’un contexte visuel plutôt que d’une simple lecture de synthèse vocale.

Quand Gemini 3.1 Flash Live Preview est-il sorti ?

Gemini 3.1 Flash Live Preview a été publié sur 1 mars 2026 selon les documents du fournisseur cités.

Où puis-je accéder à Gemini 3.1 Flash Live Preview ?

Accès en aperçu via l'API Gemini Live et Google AI Studio dans les régions prises en charge. Les voies d'accès répertoriées dans ce guide sont Google.

Combien coûte Gemini 3.1 Flash Live Preview ?

Entrée audio à 0,005 $/min · Sortie audio à 0,018 $/min. Les équivalents payants de Google ; l'entrée/sortie de texte coûte 0,75 $/4,50 $ par million de jetons et l'entrée d'image/vidéo équivaut à 0,002 $ par minute.

Où le Gemini 3.1 Flash Live Preview est-il disponible ?

Accès en aperçu via l'API Gemini Live et Google AI Studio dans les régions prises en charge. Utilisez la liste de régions Gemini API en direct de Google et confirmez l’éligibilité à l’aperçu.

Mes données API Gemini 3.1 Flash Live Preview sont-elles utilisées pour la formation ?

Google indique que le contenu Gemini API payant n'est pas utilisé pour améliorer ses produits ; les données de service non rémunérées peuvent généralement l'être. Confirmez l'état de facturation et les conditions actuelles avant d'envoyer des conversations sensibles. La politique appartient à l'itinéraire du fournisseur et aux conditions du compte, vérifiez-la donc à nouveau avant de l'utiliser en production.

Comparaisons associées

Comparaisons face à face

  1. Gemini 3.1 Flash Live Preview vs GPT-Live 1

    Frontend vocal full duplex du OpenAI pour une conversation naturelle qui délègue un raisonnement et des actions plus approfondis à un agent backend distinct.

    Ouvrir la comparaison complète
  2. Gemini 3.1 Flash Live Preview vs Gemini 3.8 Live

    Le modèle vocal en temps réel de Google pour des échanges réactifs avec audio, texte et contexte visuel.

    Ouvrir la comparaison complète
  3. Gemini 3.1 Flash Live Preview vs Gemini 3.8 Live Extended Thinking

    Un modèle vocal Gemini distinct qui traite les demandes complexes en arrière-plan tout en poursuivant la conversation.

    Ouvrir la comparaison complète
  4. Gemini 3.1 Flash Live Preview vs GPT-Realtime-2.1

    Modèle de raisonnement parole-parole en temps réel de OpenAI pour les agents vocaux utilisant des outils qui ont également besoin d'un contexte de texte et d'image.

    Ouvrir la comparaison complète
  5. Gemini 3.1 Flash Live Preview vs Eleven v3 Conversational

    Modèle de synthèse vocale en temps réel expressif de ElevenLabs pour un dialogue naturel, une transmission émotionnelle, des balises audio et plus de 70 langues.

    Ouvrir la comparaison complète
  6. Gemini 3.1 Flash Live Preview vs Inworld Realtime TTS-2

    Le tout nouveau modèle expressif de synthèse vocale en temps réel d'Inworld, conçu pour mémoriser les conversations et parler dans plus de 100 langues.

    Ouvrir la comparaison complète
  7. Gemini 3.1 Flash Live Preview vs Grok Voice Think Fast 2.0

    Modèle de parole en temps réel actuel de SpaceXAI pour les agents conversationnels en moins d'une seconde avec accès aux outils.

    Ouvrir la comparaison complète