Gemini 3.8 Live
Googles Echtzeit-Sprachmodell für flüssige Gespräche mit Audio, Text und visuellem Kontext.
Googles Echtzeit-Sprachmodell für flüssige Gespräche mit Audio, Text und visuellem Kontext.
Übersicht in einfacher englischer Sprache
Gemini 3.8 Live kann besprechen, was Nutzer sagen oder vor der Kamera zeigen, und während des Gesprächs Werkzeuge aufrufen. Anders als Gemini 3.8 Flash, das Text ausgibt, ist Live für gesprochene Interaktionen ausgelegt.
Diese Version eignet sich für Sprachassistenten im Alltag. Das Reasoning ist mit dem Gespräch verzahnt, ohne einstellbare Denktiefe. Extended Thinking ist ein separates Modell für anspruchsvollere Aufgaben.
Kategorievergleich
Hierbei handelt es sich um vom Anbieter veröffentlichte Spezifikationen, nicht um Cody-Benchmark-Ergebnisse. Folgen Sie den verlinkten Quellen für aktuelle Grenzwerte und endpunktspezifische Ausnahmen.
API- und Provider-Zugriff
Verfügbarkeit
Über die Gemini Live API und Google AI Studio in unterstützten Regionen verfügbar.
Verwenden Sie die Live-Liste der verfügbaren Regionen von Google und überprüfen Sie Funktionseinschränkungen für die ausgewählte Route.
Überprüfen Sie die Live-VerfügbarkeitDaten und Schulung
Laut Google werden bezahlte Gemini API-Eingabeaufforderungen und -Antworten nicht zur Verbesserung seiner Produkte verwendet. Unbezahlte Dienstinhalte können im Allgemeinen verwendet werden, mit unterschiedlicher Behandlung für Nutzer im EWR, im Vereinigten Königreich und in der Schweiz; Überprüfen Sie die aktuellen Bedingungen für Ihr Konto und Ihre Region.
Hierbei handelt es sich um eine prägnante Lektüre des zitierten Anbietermaterials und nicht um eine Rechtsberatung. Ein Drittanbieter-Gateway kann andere Speicher-, Routing-, Schulungs- und Residenzbedingungen haben als die direkte API des Modellherstellers.
Lesen Sie die Richtlinien des AnbietersHäufig gestellte Fragen
Googles Echtzeit-Sprachmodell für flüssige Gespräche mit Audio, Text und visuellem Kontext. Gemini 3.8 Live kann besprechen, was Nutzer sagen oder vor der Kamera zeigen, und während des Gesprächs Werkzeuge aufrufen. Anders als Gemini 3.8 Flash, das Text ausgibt, ist Live für gesprochene Interaktionen ausgelegt.
Gemini 3.8 Live wurde gemäß den zitierten Anbietermaterialien auf 15. September 2026 veröffentlicht.
Über die Gemini Live API und Google AI Studio in unterstützten Regionen verfügbar. Die in diesem Handbuch aufgeführten Zugriffsrouten sind Google.
0,005 $/Min. Audioeingang · 0,018 $/Min. Audioausgang. Tarife im kostenpflichtigen Kontingent: 3 USD für Audioeingabe und 12 USD für Audioausgabe pro Million Tokens. Text kostet 0,75 USD für Eingabe und 4,50 USD für Ausgabe; Bild-/Videoeingabe kostet 1 USD pro Million Tokens. Reasoning und kostenpflichtige Suche können Zusatzkosten verursachen.
Über die Gemini Live API und Google AI Studio in unterstützten Regionen verfügbar. Verwenden Sie die Live-Liste der verfügbaren Regionen von Google und überprüfen Sie Funktionseinschränkungen für die ausgewählte Route.
Laut Google werden bezahlte Gemini API-Eingabeaufforderungen und -Antworten nicht zur Verbesserung seiner Produkte verwendet. Unbezahlte Dienstinhalte können im Allgemeinen verwendet werden, mit unterschiedlicher Behandlung für Nutzer im EWR, im Vereinigten Königreich und in der Schweiz; Überprüfen Sie die aktuellen Bedingungen für Ihr Konto und Ihre Region. Die Richtlinie gehört zu den Routen- und Kontobedingungen des Anbieters. Überprüfen Sie sie daher vor der produktiven Nutzung erneut.
Verwandte Vergleiche
Das Vollduplex-Sprach-Frontend von OpenAI für natürliche Konversation, das tiefergehende Überlegungen und Aktionen an einen separaten Backend-Agenten delegiert.
Vollständigen Vergleich öffnenEin separates Gemini-Sprachmodell, das komplexe Anfragen im Hintergrund bearbeitet und das Gespräch dabei fortsetzt.
Vollständigen Vergleich öffnenDas Echtzeit-Speech-to-Speech-Argumentationsmodell von OpenAI für Tool-verwendende Sprachagenten, die auch Text- und Bildkontext benötigen.
Vollständigen Vergleich öffnenDas Vorschau-Audio-zu-Audio-Modell von Google für Dialoge mit geringer Latenz mit multimodalem Bewusstsein, Denken, Sucherdung und Funktionsaufruf.
Vollständigen Vergleich öffnenElevenLabs‘ ausdrucksstarkes Echtzeit-Text-to-Speech-Modell für natürliche Dialoge, emotionale Übermittlung, Audio-Tags und mehr als 70 Sprachen.
Vollständigen Vergleich öffnenDas neueste ausdrucksstarke Echtzeit-Text-to-Speech-Modell von Inworld, das darauf ausgelegt ist, sich die gesprochene Sprache zu merken und in mehr als 100 Sprachen zu sprechen.
Vollständigen Vergleich öffnenDas aktuelle Echtzeit-Speech-to-Speech-Modell von SpaceXAI für Sub-Sekunden-Konversationsagenten mit Tool-Zugriff.
Vollständigen Vergleich öffnen