Grok Voice Think Fast 2.0
Modèle de parole en temps réel actuel de SpaceXAI pour les agents conversationnels en moins d'une seconde avec accès aux outils.
Modèle de parole en temps réel actuel de SpaceXAI pour les agents conversationnels en moins d'une seconde avec accès aux outils.
Présentation de l'anglais simple
Grok Voice Think Fast 2.0 alimente l'itinéraire actuel grok-voice-latest et combine la parole en temps réel avec l'utilisation d'outils d'agent. Le fournisseur publie un prix par minute audio, ce qui facilite l'estimation des appels par rapport à la tarification audio par jeton uniquement.
L’étiquette inférieure à la seconde est une affirmation au niveau du fournisseur et non une mesure bouche-à-oreille garantie. La téléphonie, la distance du réseau, la détection de l'activité vocale, les appels d'outils et la logique des applications affectent tous l'expérience de l'utilisateur.
Comparaison des catégories
Il s'agit de spécifications publiées par le fournisseur et non de scores de référence Cody. Suivez les sources liées pour connaître les limites actuelles et les exceptions spécifiques aux points de terminaison.
Accès API et fournisseur
Disponibilité
Disponible via l'API en temps réel SpaceXAI ; le dernier alias grok-voice est dirigé vers ce modèle à partir du 5 août 2026.
La disponibilité du compte et de la région doit être vérifiée dans la console SpaceXAI.
Vérifier la disponibilité en directDonnées et formation
SpaceXAI indique qu'il ne s'entraîne pas sur les entrées ou sorties de l'API sans autorisation explicite. La conservation chiffrée par défaut est de 30 jours ; La conservation zéro des données au niveau de l’équipe est disponible avec des compromis en termes de fonctionnalités.
Il s'agit d'une lecture concise du matériel du fournisseur cité, et non d'un avis juridique. Une passerelle tierce peut avoir des conditions de stockage, de routage, de formation et de résidence différentes de celles de l'API directe du modéliste.
Lire la politique du fournisseurQuestions fréquemment posées
Modèle de parole en temps réel actuel de SpaceXAI pour les agents conversationnels en moins d'une seconde avec accès aux outils. Grok Voice Think Fast 2.0 alimente l'itinéraire actuel grok-voice-latest et combine la parole en temps réel avec l'utilisation d'outils d'agent. Le fournisseur publie un prix par minute audio, ce qui facilite l'estimation des appels par rapport à la tarification audio par jeton uniquement.
Grok Voice Think Fast 2.0 a été publié sur 29 juillet 2026 selon les documents du fournisseur cités.
Disponible via l'API en temps réel SpaceXAI ; le dernier alias grok-voice est dirigé vers ce modèle à partir du 5 août 2026. Les voies d'accès répertoriées dans ce guide sont SpaceXAI.
0,08 $/minute audio. SpaceXAI répertorie l'audio parole-parole à 0,08 $/minute plus 0,004 $ par unité de saisie de texte indiquée sur sa page de tarification.
Disponible via l'API en temps réel SpaceXAI ; le dernier alias grok-voice est dirigé vers ce modèle à partir du 5 août 2026. La disponibilité du compte et de la région doit être vérifiée dans la console SpaceXAI.
SpaceXAI indique qu'il ne s'entraîne pas sur les entrées ou sorties de l'API sans autorisation explicite. La conservation chiffrée par défaut est de 30 jours ; La conservation zéro des données au niveau de l’équipe est disponible avec des compromis en termes de fonctionnalités. La politique appartient à l'itinéraire du fournisseur et aux conditions du compte, vérifiez-la donc à nouveau avant de l'utiliser en production.
Comparaisons associées
Modèle de raisonnement parole-parole en temps réel de OpenAI pour les agents vocaux utilisant des outils qui ont également besoin d'un contexte de texte et d'image.
Ouvrir la comparaison complèteModèle audio-audio en avant-première de Google pour un dialogue à faible latence avec une conscience multimodale, une réflexion, une mise à la terre de recherche et un appel de fonction.
Ouvrir la comparaison complèteModèle de synthèse vocale en temps réel expressif de ElevenLabs pour un dialogue naturel, une transmission émotionnelle, des balises audio et plus de 70 langues.
Ouvrir la comparaison complèteLe tout nouveau modèle expressif de synthèse vocale en temps réel d'Inworld, conçu pour mémoriser les conversations et parler dans plus de 100 langues.
Ouvrir la comparaison complète