Gemini 3.8 Flash TTS
Model generowania mowy Google do ekspresyjnej narracji, głosów postaci i dialogów w 130 językach.
Model generowania mowy Google do ekspresyjnej narracji, głosów postaci i dialogów w 130 językach.
Przegląd w prostym języku angielskim
Zamień scenariusz w nagranie, wybierając głos i sposób wypowiadania każdej kwestii. Flash TTS to kreatywna opcja z tej pary, przeznaczona do narracji, akcentów i odgrywania postaci.
Oba modele obsługują projektowanie własnych głosów i scenariusze z dwoma rozmówcami. Generują mowę, nie odpowiedzi: asystent konwersacyjny nadal wymaga osobnych komponentów rozpoznawania mowy i rozumowania. Nie korzystają z Gemini Live API.
Porównanie kategorii
Są to specyfikacje opublikowane przez dostawcę, a nie wyniki testów porównawczych Cody. Skorzystaj z połączonych źródeł, aby poznać aktualne limity i wyjątki specyficzne dla punktu końcowego.
Dostęp do API i dostawcy
Dostępność
Dostępny przez Gemini API i Google AI Studio w obsługiwanych regionach.
Replikacja głosu w AI Studio nie jest dostępna w Illinois, Teksasie, EOG, Wielkiej Brytanii, Szwajcarii i Indiach. Nie oznacza to ogólnego zakazu TTS w tych regionach.
Sprawdź dostępność na żywoDane i szkolenia
Google twierdzi, że płatne monity i odpowiedzi Gemini API nie są wykorzystywane do ulepszania produktów. Zasadniczo można korzystać z treści objętych usługą bezpłatną, przy czym użytkownicy z EOG, Wielkiej Brytanii i Szwajcarii są różnie traktowani; sprawdź aktualne warunki dla swojego konta i regionu.
Jest to zwięzła lektura cytowanych materiałów dostawcy, a nie porada prawna. Brama innej firmy może mieć inne warunki przechowywania, routingu, szkolenia i miejsca zamieszkania niż bezpośrednie API twórcy modelu.
Przeczytaj politykę dostawcyCzęsto zadawane pytania
Model generowania mowy Google do ekspresyjnej narracji, głosów postaci i dialogów w 130 językach. Zamień scenariusz w nagranie, wybierając głos i sposób wypowiadania każdej kwestii. Flash TTS to kreatywna opcja z tej pary, przeznaczona do narracji, akcentów i odgrywania postaci.
Według materiałów cytowanego dostawcy Gemini 3.8 Flash TTS został wydany na 23 września 2026.
Dostępny przez Gemini API i Google AI Studio w obsługiwanych regionach. Drogi dostępu wymienione w tym przewodniku to Google.
0,50 USD za wejście tekstowe · 9 USD za wyjście audio / 1 mln tokenów. Promocyjne stawki Standard obowiązują do 31 grudnia 2026 r.; obie podwajają się 1 stycznia 2027 r. Audio zużywa 25 tokenów na sekundę. Buforowanie i inne poziomy usługi mają odrębne stawki.
Dostępny przez Gemini API i Google AI Studio w obsługiwanych regionach. Replikacja głosu w AI Studio nie jest dostępna w Illinois, Teksasie, EOG, Wielkiej Brytanii, Szwajcarii i Indiach. Nie oznacza to ogólnego zakazu TTS w tych regionach.
Google twierdzi, że płatne monity i odpowiedzi Gemini API nie są wykorzystywane do ulepszania produktów. Zasadniczo można korzystać z treści objętych usługą bezpłatną, przy czym użytkownicy z EOG, Wielkiej Brytanii i Szwajcarii są różnie traktowani; sprawdź aktualne warunki dla swojego konta i regionu. Polityka należy do warunków trasy dostawcy i konta, dlatego sprawdź ją ponownie przed użyciem w środowisku produkcyjnym.
Powiązane porównania
Tańszy model generowania mowy Google do odczytywania tekstu i masowej produkcji audio w 101 językach.
Otwórz pełne porównanieEkspresyjny model syntezy mowy ElevenLabs w czasie rzeczywistym zapewniający naturalny dialog, dostarczanie emocji, znaczniki audio i ponad 70 języków.
Otwórz pełne porównanieNajnowszy, ekspresyjny model syntezy mowy firmy Inworld w czasie rzeczywistym, zaprojektowany z myślą o zapamiętywaniu przebiegu konwersacji i mówieniu w ponad 100 językach.
Otwórz pełne porównanie