Gemini 3.1 Flash Live Preview
Model Google typu audio-to-audio umożliwiający dialog o niskim opóźnieniu ze świadomością multimodalną, myśleniem, uziemieniem wyszukiwania i wywoływaniem funkcji.
Model Google typu audio-to-audio umożliwiający dialog o niskim opóźnieniu ze świadomością multimodalną, myśleniem, uziemieniem wyszukiwania i wywoływaniem funkcji.
Przegląd w prostym języku angielskim
Gemini 3.1 Flash Live akceptuje dźwięk na żywo wraz z tekstem, obrazami i wideo, a następnie zwraca tekst i dźwięk. Jest przeznaczony do rozmów, w których wykorzystuje się niuanse akustyczne i kontekst wizualny, a nie proste odtwarzanie tekstu na mowę.
Google publikuje zarówno stawki tokenów, jak i ekwiwalenty audio na minutę. Ułatwia to wczesne planowanie budżetu, ale podstawy wyszukiwania i dane wejściowe multimodalne mogą nadal powodować oddzielne wykorzystanie.
Porównanie kategorii
Są to specyfikacje opublikowane przez dostawcę, a nie wyniki testów porównawczych Cody. Skorzystaj z połączonych źródeł, aby poznać aktualne limity i wyjątki specyficzne dla punktu końcowego.
Dostęp do API i dostawcy
Dostępność
Podgląd dostępu poprzez Gemini Live API i Google AI Studio w obsługiwanych regionach.
Skorzystaj z aktualnej listy regionów Gemini API Google i potwierdź uprawnienia do podglądu.
Sprawdź dostępność na żywoDane i szkolenia
Google twierdzi, że płatne treści Gemini API nie są wykorzystywane do ulepszania swoich produktów; ogólnie mogą być dane dotyczące bezpłatnych usług. Przed wysłaniem poufnych rozmów potwierdź status rozliczeń i aktualne warunki.
Jest to zwięzła lektura cytowanych materiałów dostawcy, a nie porada prawna. Brama innej firmy może mieć inne warunki przechowywania, routingu, szkolenia i miejsca zamieszkania niż bezpośrednie API twórcy modelu.
Przeczytaj politykę dostawcyCzęsto zadawane pytania
Model Google typu audio-to-audio umożliwiający dialog o niskim opóźnieniu ze świadomością multimodalną, myśleniem, uziemieniem wyszukiwania i wywoływaniem funkcji. Gemini 3.1 Flash Live akceptuje dźwięk na żywo wraz z tekstem, obrazami i wideo, a następnie zwraca tekst i dźwięk. Jest przeznaczony do rozmów, w których wykorzystuje się niuanse akustyczne i kontekst wizualny, a nie proste odtwarzanie tekstu na mowę.
Według materiałów cytowanego dostawcy Gemini 3.1 Flash Live Preview został wydany na 1 marca 2026.
Podgląd dostępu poprzez Gemini Live API i Google AI Studio w obsługiwanych regionach. Drogi dostępu wymienione w tym przewodniku to Google.
Wejście audio 0,005 USD/min · Wyjście audio 0,018 USD/min. Płatne odpowiedniki Google; wejście/wyjście tekstu wynosi 0,75/4,50 USD za milion tokenów, a wejście obrazu/wideo to równowartość 0,002 USD za minutę.
Podgląd dostępu poprzez Gemini Live API i Google AI Studio w obsługiwanych regionach. Skorzystaj z aktualnej listy regionów Gemini API Google i potwierdź uprawnienia do podglądu.
Google twierdzi, że płatne treści Gemini API nie są wykorzystywane do ulepszania swoich produktów; ogólnie mogą być dane dotyczące bezpłatnych usług. Przed wysłaniem poufnych rozmów potwierdź status rozliczeń i aktualne warunki. Polityka należy do warunków trasy dostawcy i konta, dlatego sprawdź ją ponownie przed użyciem w środowisku produkcyjnym.
Powiązane porównania
Model wnioskowania mowy na mowę OpenAI w czasie rzeczywistym dla agentów głosowych korzystających z narzędzi, którzy również potrzebują kontekstu tekstowego i obrazu.
Otwórz pełne porównanieEkspresyjny model syntezy mowy ElevenLabs w czasie rzeczywistym zapewniający naturalny dialog, dostarczanie emocji, znaczniki audio i ponad 70 języków.
Otwórz pełne porównanieNajnowszy, ekspresyjny model syntezy mowy firmy Inworld w czasie rzeczywistym, zaprojektowany z myślą o zapamiętywaniu przebiegu konwersacji i mówieniu w ponad 100 językach.
Otwórz pełne porównanieObecny model zamiany mowy na mowę SpaceXAI w czasie rzeczywistym dla agentów konwersacyjnych w czasie krótszym niż sekunda z dostępem do narzędzi.
Otwórz pełne porównanie