Wszystkie modele
Google

Gemini 3.8 Live

Model głosowy Google do płynnych rozmów w czasie rzeczywistym z dźwiękiem, tekstem i kontekstem wizualnym.

Przegląd w prostym języku angielskim

Czym właściwie jest Gemini 3.8 Live

Gemini 3.8 Live może omawiać to, co użytkownik mówi lub pokazuje przed kamerą, i wywoływać narzędzia podczas rozmowy. W odróżnieniu od Gemini 3.8 Flash, który zwraca tekst, Live służy do interakcji głosowych.

Wybierz tę wersję do codziennych asystentów głosowych. Rozumowanie przeplata się z rozmową, bez regulacji poziomu myślenia. Extended Thinking to osobny model do bardziej złożonych zadań.

Dobre dopasowanie do

  • Konwersacyjna obsługa klienta
  • Asystenci głosowi z kontekstem z kamery
  • Codzienni agenci głosowi korzystający z narzędzi

Porównanie kategorii

Fakty, które mają znaczenie w przypadku modeli głos

Są to specyfikacje opublikowane przez dostawcę, a nie wyniki testów porównawczych Cody. Skorzystaj z połączonych źródeł, aby poznać aktualne limity i wyjątki specyficzne dla punktu końcowego.

Podstawa ceny
Dźwięk 0,005 USD/min na wejściu · 0,018 USD/min na wyjściuCena oparta na tokenach, znakach lub minutach dla podanej trasy dostępu.
Tryb interakcji
Mowa na mowę z wejściem wizualnym i przeplatanym rozumowaniemZachowanie polegające na zamianie mowy na mowę, audio na dźwięk lub strumieniowej zamianie tekstu na mowę.
Opublikowane opóźnienie
NieopublikowanePomiar opublikowany przez dostawcę z podanymi wyłączeniami; nie jest to test Cody.
Języki
97 języków (według zapowiedzi Google)Zakres języka udokumentowany przez dostawcę lub wyraźny, niepublikowany znacznik.
Narzędzia i kontrola
Funkcje (domyślnie asynchroniczne), ugruntowanie w wyszukiwaniuNatywne wywoływanie funkcji, wnioskowanie lub funkcje kontroli mowy.
Kontekst lub limit wejściowy
131 072 wejść · 65 536 wyjśćUdokumentowany limit tokenów lub znaków, jeśli ma to znaczenie.

Dostęp do API i dostawcy

Gdzie zdobyć Gemini 3.8 Live

Dostępność

Regiony i etap dostępu

Dostępny przez Gemini Live API i Google AI Studio w obsługiwanych regionach.

Skorzystaj z aktualnej listy dostępnych regionów Google i sprawdź ograniczenia funkcji dla wybranej trasy.

Sprawdź dostępność na żywo

Dane i szkolenia

Trasa ma znaczenie.

Google twierdzi, że płatne monity i odpowiedzi Gemini API nie są wykorzystywane do ulepszania produktów. Zasadniczo można korzystać z treści objętych usługą bezpłatną, przy czym użytkownicy z EOG, Wielkiej Brytanii i Szwajcarii są różnie traktowani; sprawdź aktualne warunki dla swojego konta i regionu.

Jest to zwięzła lektura cytowanych materiałów dostawcy, a nie porada prawna. Brama innej firmy może mieć inne warunki przechowywania, routingu, szkolenia i miejsca zamieszkania niż bezpośrednie API twórcy modelu.

Przeczytaj politykę dostawcy

Często zadawane pytania

Często zadawane pytania dotyczące Gemini 3.8 Live

Co to jest Gemini 3.8 Live?

Model głosowy Google do płynnych rozmów w czasie rzeczywistym z dźwiękiem, tekstem i kontekstem wizualnym. Gemini 3.8 Live może omawiać to, co użytkownik mówi lub pokazuje przed kamerą, i wywoływać narzędzia podczas rozmowy. W odróżnieniu od Gemini 3.8 Flash, który zwraca tekst, Live służy do interakcji głosowych.

Kiedy wypuszczono Gemini 3.8 Live?

Według materiałów cytowanego dostawcy Gemini 3.8 Live został wydany na 15 września 2026.

Gdzie mogę uzyskać dostęp do Gemini 3.8 Live?

Dostępny przez Gemini Live API i Google AI Studio w obsługiwanych regionach. Drogi dostępu wymienione w tym przewodniku to Google.

Ile kosztuje Gemini 3.8 Live?

Wejście audio 0,005 USD/min · Wyjście audio 0,018 USD/min. Stawki płatnego planu: 3 USD za wejście audio i 12 USD za wyjście na milion tokenów. Tekst kosztuje 0,75 USD za wejście i 4,50 USD za wyjście; wejście obrazu/wideo kosztuje 1 USD na milion tokenów. Rozumowanie i płatne wyszukiwanie mogą zwiększyć koszt.

Gdzie jest dostępny Gemini 3.8 Live?

Dostępny przez Gemini Live API i Google AI Studio w obsługiwanych regionach. Skorzystaj z aktualnej listy dostępnych regionów Google i sprawdź ograniczenia funkcji dla wybranej trasy.

Czy moje dane API Gemini 3.8 Live są wykorzystywane do szkolenia?

Google twierdzi, że płatne monity i odpowiedzi Gemini API nie są wykorzystywane do ulepszania produktów. Zasadniczo można korzystać z treści objętych usługą bezpłatną, przy czym użytkownicy z EOG, Wielkiej Brytanii i Szwajcarii są różnie traktowani; sprawdź aktualne warunki dla swojego konta i regionu. Polityka należy do warunków trasy dostawcy i konta, dlatego sprawdź ją ponownie przed użyciem w środowisku produkcyjnym.

Powiązane porównania

Porównania bezpośrednie

  1. Gemini 3.8 Live vs GPT-Live 1

    Pełnodupleksowy interfejs głosowy OpenAI zapewniający naturalną konwersację, który przekazuje głębsze rozumowanie i działania oddzielnemu agentowi zaplecza.

    Otwórz pełne porównanie
  2. Gemini 3.8 Live vs Gemini 3.8 Live Extended Thinking

    Osobny model głosowy Gemini, który przetwarza złożone prośby w tle, podtrzymując rozmowę.

    Otwórz pełne porównanie
  3. Gemini 3.8 Live vs GPT-Realtime-2.1

    Model wnioskowania mowy na mowę OpenAI w czasie rzeczywistym dla agentów głosowych korzystających z narzędzi, którzy również potrzebują kontekstu tekstowego i obrazu.

    Otwórz pełne porównanie
  4. Gemini 3.8 Live vs Gemini 3.1 Flash Live Preview

    Model Google typu audio-to-audio umożliwiający dialog o niskim opóźnieniu ze świadomością multimodalną, myśleniem, uziemieniem wyszukiwania i wywoływaniem funkcji.

    Otwórz pełne porównanie
  5. Gemini 3.8 Live vs Eleven v3 Conversational

    Ekspresyjny model syntezy mowy ElevenLabs w czasie rzeczywistym zapewniający naturalny dialog, dostarczanie emocji, znaczniki audio i ponad 70 języków.

    Otwórz pełne porównanie
  6. Gemini 3.8 Live vs Inworld Realtime TTS-2

    Najnowszy, ekspresyjny model syntezy mowy firmy Inworld w czasie rzeczywistym, zaprojektowany z myślą o zapamiętywaniu przebiegu konwersacji i mówieniu w ponad 100 językach.

    Otwórz pełne porównanie
  7. Gemini 3.8 Live vs Grok Voice Think Fast 2.0

    Obecny model zamiany mowy na mowę SpaceXAI w czasie rzeczywistym dla agentów konwersacyjnych w czasie krótszym niż sekunda z dostępem do narzędzi.

    Otwórz pełne porównanie