Tous les modèles
OpenAI

GPT-Realtime-2.1

Modèle de raisonnement parole-parole en temps réel de OpenAI pour les agents vocaux utilisant des outils qui ont également besoin d'un contexte de texte et d'image.

Présentation de l'anglais simple

Qu'est-ce que GPT-Realtime-2.1 ?

GPT-Realtime-2.1 est conçu pour les conversations en direct où le modèle doit écouter, parler, suivre les instructions et appeler des outils au cours d'une seule session en temps réel. OpenAI met en évidence une amélioration de la gestion des interruptions, du silence, du bruit et des caractères alphanumériques par rapport à la version précédente.

Les entrées audio, texte et image sont facturées dans différentes classes de jetons. Un budget réaliste nécessite donc une utilisation capturée à partir de conversations complètes, et non une simple conversion à partir des seules minutes audio.

Bon ajustement pour

  • Agents vocaux clients ou employés utilisant des outils
  • Assistants multimodaux en temps réel
  • Piles d'agents natives OpenAI

Comparaison des catégories

Les faits importants pour les modèles voix

Il s'agit de spécifications publiées par le fournisseur et non de scores de référence Cody. Suivez les sources liées pour connaître les limites actuelles et les exceptions spécifiques aux points de terminaison.

Base de prix
Audio 32 $ en entrée · 64 $ en sortie / 1 million de jetonsPrix basé sur un jeton, un caractère ou une minute pour l'itinéraire d'accès répertorié.
Mode d'interaction
Synthèse vocale avec contexte texte/imageComportement parole-parole, audio-audio ou synthèse vocale en streaming.
Latence publiée
Non publiéMesure publiée par le fournisseur avec ses exclusions indiquées ; pas un test Cody.
Langues
Multilingue ; liste exacte non publiée iciCouverture linguistique documentée par le fournisseur ou marqueur clair non publié.
Outils et contrôle
Appel de fonction et raisonnement configurableFonctionnalités natives d’appel de fonctions, de raisonnement ou de contrôle vocal.
Contexte ou limite d'entrée
Entrée 128K · Sortie maximale 32KLimite de jetons ou de caractères documentée lorsque cela est significatif.

Accès API et fournisseur

Où obtenir GPT-Realtime-2.1

Disponibilité

Régions et étape d'accès

Disponible via l'API en temps réel de OpenAI dans les pays et territoires pris en charge.

L'accès direct suit la liste des pays pris en charge en direct par OpenAI.

Vérifier la disponibilité en direct

Données et formation

L'itinéraire compte.

OpenAI indique que le contenu de l'API n'est pas utilisé par défaut pour la formation. Les journaux de surveillance des abus par défaut peuvent être conservés jusqu'à 30 jours, avec des contrôles supplémentaires disponibles pour les organisations éligibles.

Il s'agit d'une lecture concise du matériel du fournisseur cité, et non d'un avis juridique. Une passerelle tierce peut avoir des conditions de stockage, de routage, de formation et de résidence différentes de celles de l'API directe du modéliste.

Lire la politique du fournisseur

Questions fréquemment posées

FAQ GPT-Realtime-2.1

Qu'est-ce que GPT-Realtime-2.1 ?

Modèle de raisonnement parole-parole en temps réel de OpenAI pour les agents vocaux utilisant des outils qui ont également besoin d'un contexte de texte et d'image. GPT-Realtime-2.1 est conçu pour les conversations en direct où le modèle doit écouter, parler, suivre les instructions et appeler des outils au cours d'une seule session en temps réel. OpenAI met en évidence une amélioration de la gestion des interruptions, du silence, du bruit et des caractères alphanumériques par rapport à la version précédente.

Quand GPT-Realtime-2.1 est-il sorti ?

Le fournisseur ne publie pas de date de sortie claire pour GPT-Realtime-2.1 dans le matériel source examiné par Cody.

Où puis-je accéder à GPT-Realtime-2.1 ?

Disponible via l'API en temps réel de OpenAI dans les pays et territoires pris en charge. Les voies d'accès répertoriées dans ce guide sont OpenAI.

Combien coûte GPT-Realtime-2.1 ?

Entrée audio à 32 $ · Sortie audio à 64 $ / 1 million de jetons. Le texte coûte 4 $ en entrée et 24 $ en sortie par million de jetons ; l'entrée d'image est de 5 $ par million de jetons. Les taux d'entrée en cache diffèrent.

Où le GPT-Realtime-2.1 est-il disponible ?

Disponible via l'API en temps réel de OpenAI dans les pays et territoires pris en charge. L'accès direct suit la liste des pays pris en charge en direct par OpenAI.

Mes données API GPT-Realtime-2.1 sont-elles utilisées pour la formation ?

OpenAI indique que le contenu de l'API n'est pas utilisé par défaut pour la formation. Les journaux de surveillance des abus par défaut peuvent être conservés jusqu'à 30 jours, avec des contrôles supplémentaires disponibles pour les organisations éligibles. La politique appartient à l'itinéraire du fournisseur et aux conditions du compte, vérifiez-la donc à nouveau avant de l'utiliser en production.