Grok Voice Think Fast 2.0
Das aktuelle Echtzeit-Speech-to-Speech-Modell von SpaceXAI für Sub-Sekunden-Konversationsagenten mit Tool-Zugriff.
Das aktuelle Echtzeit-Speech-to-Speech-Modell von SpaceXAI für Sub-Sekunden-Konversationsagenten mit Tool-Zugriff.
Übersicht in einfacher englischer Sprache
Grok Voice Think Fast 2.0 unterstützt die aktuelle Route „grok-voice-latest“ und kombiniert Echtzeit-Sprache mit der Verwendung von Agent-Tools. Der Anbieter veröffentlicht einen Preis pro Audiominute, sodass Anrufe einfacher geschätzt werden können als bei reinen Token-Audiopreisen.
Bei der Sub-Second-Kennzeichnung handelt es sich um eine Aussage auf Anbieterebene, nicht um eine garantierte Mund-zu-Ohr-Messung. Telefonie, Netzwerkentfernung, Sprachaktivitätserkennung, Toolaufrufe und Anwendungslogik wirken sich alle auf das Benutzererlebnis aus.
Kategorievergleich
Hierbei handelt es sich um vom Anbieter veröffentlichte Spezifikationen, nicht um Cody-Benchmark-Ergebnisse. Folgen Sie den verlinkten Quellen für aktuelle Grenzwerte und endpunktspezifische Ausnahmen.
API- und Provider-Zugriff
Verfügbarkeit
Verfügbar über die SpaceXAI Realtime API; Der Alias grok-voice-latest leitet ab dem 5. August 2026 zu diesem Modell.
Konto- und regionale Verfügbarkeit sollten in der SpaceXAI-Konsole überprüft werden.
Überprüfen Sie die Live-VerfügbarkeitDaten und Schulung
SpaceXAI gibt an, dass ohne ausdrückliche Genehmigung kein Training für API-Eingaben oder -Ausgaben durchgeführt wird. Die standardmäßige verschlüsselte Aufbewahrung beträgt 30 Tage; Eine Datenaufbewahrung ohne Datenverlust auf Teamebene ist mit Kompromissen bei den Funktionen möglich.
Hierbei handelt es sich um eine prägnante Lektüre des zitierten Anbietermaterials und nicht um eine Rechtsberatung. Ein Drittanbieter-Gateway kann andere Speicher-, Routing-, Schulungs- und Residenzbedingungen haben als die direkte API des Modellherstellers.
Lesen Sie die Richtlinien des AnbietersHäufig gestellte Fragen
Das aktuelle Echtzeit-Speech-to-Speech-Modell von SpaceXAI für Sub-Sekunden-Konversationsagenten mit Tool-Zugriff. Grok Voice Think Fast 2.0 unterstützt die aktuelle Route „grok-voice-latest“ und kombiniert Echtzeit-Sprache mit der Verwendung von Agent-Tools. Der Anbieter veröffentlicht einen Preis pro Audiominute, sodass Anrufe einfacher geschätzt werden können als bei reinen Token-Audiopreisen.
Grok Voice Think Fast 2.0 wurde gemäß den zitierten Anbietermaterialien auf 29. Juli 2026 veröffentlicht.
Verfügbar über die SpaceXAI Realtime API; Der Alias grok-voice-latest leitet ab dem 5. August 2026 zu diesem Modell. Die in diesem Handbuch aufgeführten Zugriffsrouten sind SpaceXAI.
0,08 $/Audiominute. SpaceXAI listet Speech-to-Speech-Audio für 0,08 $/Minute plus 0,004 $ pro Texteingabeeinheit auf, die auf der Preisseite angezeigt wird.
Verfügbar über die SpaceXAI Realtime API; Der Alias grok-voice-latest leitet ab dem 5. August 2026 zu diesem Modell. Konto- und regionale Verfügbarkeit sollten in der SpaceXAI-Konsole überprüft werden.
SpaceXAI gibt an, dass ohne ausdrückliche Genehmigung kein Training für API-Eingaben oder -Ausgaben durchgeführt wird. Die standardmäßige verschlüsselte Aufbewahrung beträgt 30 Tage; Eine Datenaufbewahrung ohne Datenverlust auf Teamebene ist mit Kompromissen bei den Funktionen möglich. Die Richtlinie gehört zu den Routen- und Kontobedingungen des Anbieters. Überprüfen Sie sie daher vor der produktiven Nutzung erneut.
Verwandte Vergleiche
Das Echtzeit-Speech-to-Speech-Argumentationsmodell von OpenAI für Tool-verwendende Sprachagenten, die auch Text- und Bildkontext benötigen.
Vollständigen Vergleich öffnenDas Vorschau-Audio-zu-Audio-Modell von Google für Dialoge mit geringer Latenz mit multimodalem Bewusstsein, Denken, Sucherdung und Funktionsaufruf.
Vollständigen Vergleich öffnenElevenLabs‘ ausdrucksstarkes Echtzeit-Text-to-Speech-Modell für natürliche Dialoge, emotionale Übermittlung, Audio-Tags und mehr als 70 Sprachen.
Vollständigen Vergleich öffnenDas neueste ausdrucksstarke Echtzeit-Text-to-Speech-Modell von Inworld, das darauf ausgelegt ist, sich die gesprochene Sprache zu merken und in mehr als 100 Sprachen zu sprechen.
Vollständigen Vergleich öffnen