Gemini 3.8 Flash TTS
Le modèle vocal de Google pour la narration expressive, les voix de personnages et les dialogues dans 130 langues.
Le modèle vocal de Google pour la narration expressive, les voix de personnages et les dialogues dans 130 langues.
Présentation de l'anglais simple
Transformez un script en audio en choisissant une voix et en dirigeant chaque réplique. Flash TTS est l'option créative de ce duo, destinée à la narration, aux accents et à l'interprétation de personnages.
Les deux modèles permettent de créer des voix et des scripts à deux intervenants. Ils génèrent de la parole, pas des réponses : un assistant conversationnel a toujours besoin de composants distincts d'écoute et de raisonnement. Ils n'utilisent pas l'API Gemini Live.
Comparaison des catégories
Il s'agit de spécifications publiées par le fournisseur et non de scores de référence Cody. Suivez les sources liées pour connaître les limites actuelles et les exceptions spécifiques aux points de terminaison.
Accès API et fournisseur
Disponibilité
Disponible via l'API Gemini et Google AI Studio dans les régions prises en charge.
La réplication vocale dans AI Studio exclut l'Illinois, le Texas, l'EEE, le Royaume-Uni, la Suisse et l'Inde. Cette restriction ne constitue pas une interdiction générale de la synthèse vocale dans ces régions.
Vérifier la disponibilité en directDonnées et formation
Google indique que les invites et réponses Gemini API payantes ne sont pas utilisées pour améliorer ses produits. Le contenu des services non payants peut généralement être utilisé, avec un traitement différent pour les utilisateurs de l'EEE, du Royaume-Uni et de la Suisse ; vérifiez les conditions actuelles de votre compte et de votre région.
Il s'agit d'une lecture concise du matériel du fournisseur cité, et non d'un avis juridique. Une passerelle tierce peut avoir des conditions de stockage, de routage, de formation et de résidence différentes de celles de l'API directe du modéliste.
Lire la politique du fournisseurQuestions fréquemment posées
Le modèle vocal de Google pour la narration expressive, les voix de personnages et les dialogues dans 130 langues. Transformez un script en audio en choisissant une voix et en dirigeant chaque réplique. Flash TTS est l'option créative de ce duo, destinée à la narration, aux accents et à l'interprétation de personnages.
Gemini 3.8 Flash TTS a été publié sur 23 septembre 2026 selon les documents du fournisseur cités.
Disponible via l'API Gemini et Google AI Studio dans les régions prises en charge. Les voies d'accès répertoriées dans ce guide sont Google.
0,50 $ en entrée texte · 9 $ en sortie audio / 1 M de tokens. Tarifs de lancement Standard jusqu'au 31 décembre 2026 ; les deux doublent le 1er janvier 2027. L'audio utilise 25 tokens par seconde. Le cache et les autres niveaux de service ont des tarifs différents.
Disponible via l'API Gemini et Google AI Studio dans les régions prises en charge. La réplication vocale dans AI Studio exclut l'Illinois, le Texas, l'EEE, le Royaume-Uni, la Suisse et l'Inde. Cette restriction ne constitue pas une interdiction générale de la synthèse vocale dans ces régions.
Google indique que les invites et réponses Gemini API payantes ne sont pas utilisées pour améliorer ses produits. Le contenu des services non payants peut généralement être utilisé, avec un traitement différent pour les utilisateurs de l'EEE, du Royaume-Uni et de la Suisse ; vérifiez les conditions actuelles de votre compte et de votre région. La politique appartient à l'itinéraire du fournisseur et aux conditions du compte, vérifiez-la donc à nouveau avant de l'utiliser en production.
Comparaisons associées
Le modèle vocal moins coûteux de Google pour la lecture à voix haute et la production audio à grande échelle dans 101 langues.
Ouvrir la comparaison complèteModèle de synthèse vocale en temps réel expressif de ElevenLabs pour un dialogue naturel, une transmission émotionnelle, des balises audio et plus de 70 langues.
Ouvrir la comparaison complèteLe tout nouveau modèle expressif de synthèse vocale en temps réel d'Inworld, conçu pour mémoriser les conversations et parler dans plus de 100 langues.
Ouvrir la comparaison complète