Gemini 3.8 Live
Model głosowy Google do płynnych rozmów w czasie rzeczywistym z dźwiękiem, tekstem i kontekstem wizualnym.
Model głosowy Google do płynnych rozmów w czasie rzeczywistym z dźwiękiem, tekstem i kontekstem wizualnym.
Przegląd w prostym języku angielskim
Gemini 3.8 Live może omawiać to, co użytkownik mówi lub pokazuje przed kamerą, i wywoływać narzędzia podczas rozmowy. W odróżnieniu od Gemini 3.8 Flash, który zwraca tekst, Live służy do interakcji głosowych.
Wybierz tę wersję do codziennych asystentów głosowych. Rozumowanie przeplata się z rozmową, bez regulacji poziomu myślenia. Extended Thinking to osobny model do bardziej złożonych zadań.
Porównanie kategorii
Są to specyfikacje opublikowane przez dostawcę, a nie wyniki testów porównawczych Cody. Skorzystaj z połączonych źródeł, aby poznać aktualne limity i wyjątki specyficzne dla punktu końcowego.
Dostęp do API i dostawcy
Dostępność
Dostępny przez Gemini Live API i Google AI Studio w obsługiwanych regionach.
Skorzystaj z aktualnej listy dostępnych regionów Google i sprawdź ograniczenia funkcji dla wybranej trasy.
Sprawdź dostępność na żywoDane i szkolenia
Google twierdzi, że płatne monity i odpowiedzi Gemini API nie są wykorzystywane do ulepszania produktów. Zasadniczo można korzystać z treści objętych usługą bezpłatną, przy czym użytkownicy z EOG, Wielkiej Brytanii i Szwajcarii są różnie traktowani; sprawdź aktualne warunki dla swojego konta i regionu.
Jest to zwięzła lektura cytowanych materiałów dostawcy, a nie porada prawna. Brama innej firmy może mieć inne warunki przechowywania, routingu, szkolenia i miejsca zamieszkania niż bezpośrednie API twórcy modelu.
Przeczytaj politykę dostawcyCzęsto zadawane pytania
Model głosowy Google do płynnych rozmów w czasie rzeczywistym z dźwiękiem, tekstem i kontekstem wizualnym. Gemini 3.8 Live może omawiać to, co użytkownik mówi lub pokazuje przed kamerą, i wywoływać narzędzia podczas rozmowy. W odróżnieniu od Gemini 3.8 Flash, który zwraca tekst, Live służy do interakcji głosowych.
Według materiałów cytowanego dostawcy Gemini 3.8 Live został wydany na 15 września 2026.
Dostępny przez Gemini Live API i Google AI Studio w obsługiwanych regionach. Drogi dostępu wymienione w tym przewodniku to Google.
Wejście audio 0,005 USD/min · Wyjście audio 0,018 USD/min. Stawki płatnego planu: 3 USD za wejście audio i 12 USD za wyjście na milion tokenów. Tekst kosztuje 0,75 USD za wejście i 4,50 USD za wyjście; wejście obrazu/wideo kosztuje 1 USD na milion tokenów. Rozumowanie i płatne wyszukiwanie mogą zwiększyć koszt.
Dostępny przez Gemini Live API i Google AI Studio w obsługiwanych regionach. Skorzystaj z aktualnej listy dostępnych regionów Google i sprawdź ograniczenia funkcji dla wybranej trasy.
Google twierdzi, że płatne monity i odpowiedzi Gemini API nie są wykorzystywane do ulepszania produktów. Zasadniczo można korzystać z treści objętych usługą bezpłatną, przy czym użytkownicy z EOG, Wielkiej Brytanii i Szwajcarii są różnie traktowani; sprawdź aktualne warunki dla swojego konta i regionu. Polityka należy do warunków trasy dostawcy i konta, dlatego sprawdź ją ponownie przed użyciem w środowisku produkcyjnym.
Powiązane porównania
Pełnodupleksowy interfejs głosowy OpenAI zapewniający naturalną konwersację, który przekazuje głębsze rozumowanie i działania oddzielnemu agentowi zaplecza.
Otwórz pełne porównanieOsobny model głosowy Gemini, który przetwarza złożone prośby w tle, podtrzymując rozmowę.
Otwórz pełne porównanieModel wnioskowania mowy na mowę OpenAI w czasie rzeczywistym dla agentów głosowych korzystających z narzędzi, którzy również potrzebują kontekstu tekstowego i obrazu.
Otwórz pełne porównanieModel Google typu audio-to-audio umożliwiający dialog o niskim opóźnieniu ze świadomością multimodalną, myśleniem, uziemieniem wyszukiwania i wywoływaniem funkcji.
Otwórz pełne porównanieEkspresyjny model syntezy mowy ElevenLabs w czasie rzeczywistym zapewniający naturalny dialog, dostarczanie emocji, znaczniki audio i ponad 70 języków.
Otwórz pełne porównanieNajnowszy, ekspresyjny model syntezy mowy firmy Inworld w czasie rzeczywistym, zaprojektowany z myślą o zapamiętywaniu przebiegu konwersacji i mówieniu w ponad 100 językach.
Otwórz pełne porównanieObecny model zamiany mowy na mowę SpaceXAI w czasie rzeczywistym dla agentów konwersacyjnych w czasie krótszym niż sekunda z dostępem do narzędzi.
Otwórz pełne porównanie