Gemini 3.8 Live Extended Thinking
Osobny model głosowy Gemini, który przetwarza złożone prośby w tle, podtrzymując rozmowę.
Osobny model głosowy Gemini, który przetwarza złożone prośby w tle, podtrzymując rozmowę.
Przegląd w prostym języku angielskim
Extended Thinking łączy mowę na żywo z planowaniem i użyciem narzędzi w tle. Może głosowo informować o postępie podczas realizacji wieloetapowej prośby, z niskim, średnim lub wysokim poziomem myślenia.
Limity wejścia i wyjścia są takie same jak w Gemini 3.8 Live. Google podaje identyczne stawki za tokeny, lecz dodatkowe rozumowanie może zwiększyć zużycie. GPT-Live 1 przekazuje natomiast bardziej złożone zadania osobno wybranemu agentowi zaplecza.
Porównanie kategorii
Są to specyfikacje opublikowane przez dostawcę, a nie wyniki testów porównawczych Cody. Skorzystaj z połączonych źródeł, aby poznać aktualne limity i wyjątki specyficzne dla punktu końcowego.
Dostęp do API i dostawcy
Dostępność
Dostępny przez Gemini Live API i Google AI Studio w obsługiwanych regionach.
Skorzystaj z aktualnej listy dostępnych regionów Google i sprawdź ograniczenia funkcji dla wybranej trasy.
Sprawdź dostępność na żywoDane i szkolenia
Google twierdzi, że płatne monity i odpowiedzi Gemini API nie są wykorzystywane do ulepszania produktów. Zasadniczo można korzystać z treści objętych usługą bezpłatną, przy czym użytkownicy z EOG, Wielkiej Brytanii i Szwajcarii są różnie traktowani; sprawdź aktualne warunki dla swojego konta i regionu.
Jest to zwięzła lektura cytowanych materiałów dostawcy, a nie porada prawna. Brama innej firmy może mieć inne warunki przechowywania, routingu, szkolenia i miejsca zamieszkania niż bezpośrednie API twórcy modelu.
Przeczytaj politykę dostawcyCzęsto zadawane pytania
Osobny model głosowy Gemini, który przetwarza złożone prośby w tle, podtrzymując rozmowę. Extended Thinking łączy mowę na żywo z planowaniem i użyciem narzędzi w tle. Może głosowo informować o postępie podczas realizacji wieloetapowej prośby, z niskim, średnim lub wysokim poziomem myślenia.
Według materiałów cytowanego dostawcy Gemini 3.8 Live Extended Thinking został wydany na 15 września 2026.
Dostępny przez Gemini Live API i Google AI Studio w obsługiwanych regionach. Drogi dostępu wymienione w tym przewodniku to Google.
Wejście audio 0,005 USD/min · Wyjście audio 0,018 USD/min. Stawki płatnego planu: 3 USD za wejście audio i 12 USD za wyjście na milion tokenów. Tekst kosztuje 0,75 USD za wejście i 4,50 USD za wyjście; wejście obrazu/wideo kosztuje 1 USD na milion tokenów. Rozumowanie i płatne wyszukiwanie mogą zwiększyć koszt.
Dostępny przez Gemini Live API i Google AI Studio w obsługiwanych regionach. Skorzystaj z aktualnej listy dostępnych regionów Google i sprawdź ograniczenia funkcji dla wybranej trasy.
Google twierdzi, że płatne monity i odpowiedzi Gemini API nie są wykorzystywane do ulepszania produktów. Zasadniczo można korzystać z treści objętych usługą bezpłatną, przy czym użytkownicy z EOG, Wielkiej Brytanii i Szwajcarii są różnie traktowani; sprawdź aktualne warunki dla swojego konta i regionu. Polityka należy do warunków trasy dostawcy i konta, dlatego sprawdź ją ponownie przed użyciem w środowisku produkcyjnym.
Powiązane porównania
Pełnodupleksowy interfejs głosowy OpenAI zapewniający naturalną konwersację, który przekazuje głębsze rozumowanie i działania oddzielnemu agentowi zaplecza.
Otwórz pełne porównanieModel głosowy Google do płynnych rozmów w czasie rzeczywistym z dźwiękiem, tekstem i kontekstem wizualnym.
Otwórz pełne porównanieModel wnioskowania mowy na mowę OpenAI w czasie rzeczywistym dla agentów głosowych korzystających z narzędzi, którzy również potrzebują kontekstu tekstowego i obrazu.
Otwórz pełne porównanieModel Google typu audio-to-audio umożliwiający dialog o niskim opóźnieniu ze świadomością multimodalną, myśleniem, uziemieniem wyszukiwania i wywoływaniem funkcji.
Otwórz pełne porównanieEkspresyjny model syntezy mowy ElevenLabs w czasie rzeczywistym zapewniający naturalny dialog, dostarczanie emocji, znaczniki audio i ponad 70 języków.
Otwórz pełne porównanieNajnowszy, ekspresyjny model syntezy mowy firmy Inworld w czasie rzeczywistym, zaprojektowany z myślą o zapamiętywaniu przebiegu konwersacji i mówieniu w ponad 100 językach.
Otwórz pełne porównanieObecny model zamiany mowy na mowę SpaceXAI w czasie rzeczywistym dla agentów konwersacyjnych w czasie krótszym niż sekunda z dostępem do narzędzi.
Otwórz pełne porównanie