- Outils d'IA
- Intelligence artificielle
GPT Live 1 API est là : prix, fonctionnalités et fonctionnement
Le GPT Live 1 apporte des conversations vocales en duplex intégral au OpenAI API. Découvrez comment cela fonctionne, ce que comprend 0,05 $ par minute et comment cela se compare à GPT-Realtime-2.1.

OpenAI a apporté aux développeurs une conversation en duplex intégral de style ChatGPT. Le changement important n’est pas seulement une nouvelle voix, c’est une nouvelle division du travail entre la conversation et le travail qui se déroule derrière elle.
Les assistants vocaux se sont rapidement améliorés, mais beaucoup dévoilent encore leurs machines. Ils attendent trop impatiemment pendant une pause, continuent de parler après votre interruption ou se taisent pendant qu'un outil recherche une commande. OpenAI Lancement du GPT-Live 1 API est une tentative de rendre cette machinerie moins visible.
Sorti le 10 septembre 2026, GPT-Live 1 peut écouter et parler en même temps. Il gère lui-même le rythme de la conversation, tandis qu'un modèle ou un agent backend distinct peut raisonner, rechercher, appeler des outils approuvés et renvoyer un résultat. Cette architecture est l’idée centrale à comprendre avant de comparer des prix ou des benchmarks.
Ce guide explique ce qu'est GPT Live 1, ce que c'est 0,05 $ par minute le prix comprend, comment fonctionne la délégation et en quoi elle diffère de GPT-Realtime-2.1 et les pipelines vocaux traditionnels. Nous utilisons « GPT Live 1 » là où les gens sont susceptibles de le rechercher ; OpenAI stylise le nom du produit GPT-Live 1, et l'ID exact du modèle API est gpt-live-1.
Réponse rapide — vérifiée le 11 septembre 2026
GPT-Live 1 est désormais disponible dans le OpenAI API. Coûts du frontend vocal full-duplex 0,05 $ par minute de session, facturé à la seconde. L'utilisation du modèle backend, les outils, la téléphonie et votre infrastructure d'applications sont des coûts distincts. Il prend en charge les entrées/sorties texte et audio, le streaming et l'utilisation d'outils délégués ; l'image et la vidéo ne sont pas prises en charge par l'interface Live.
| Fait GPT Live 1 | Détail confirmé |
|---|---|
| Date de sortie | 10 septembre 2026 |
| ID du modèle API | gpt-live-1 |
| Prix | 0,05 $ par minute de session vocale, facturé à la seconde |
| Frais supplémentaires | Modèle backend, outils, téléphonie, stockage et infrastructure d'applications |
| Entrées → sorties | Texte et audio → texte et audio |
| Connexions | WebRTC, WebSockets, contrôle du serveur de bande latérale et chemins de téléphonie/SIP |
| Seuil de connaissances | 31 juillet 2025 |
| Niveau API gratuit | Non pris en charge |
Qu'est-ce que GPT Live 1 ?
GPT-Live 1 est un modèle vocal en temps réel conçu pour gérer la couche conversationnelle d'une application. Il reçoit un flux audio continu, produit de la parole et raisonne ensemble sur l'audio entrant et sortant. En clair, il n’est pas nécessaire qu’il arrête d’écouter simplement parce qu’il a commencé à parler.
Cela rend le modèle bien adapté aux parties désordonnées du discours réel : accusés de réception « mm-hm », hésitations, rires, conversation de fond, corrections au milieu d'une phrase et interruptions qui changent ce que veut réellement l'orateur.
GPT-Live 1 n'est pas destiné à prendre en charge tous les flux de travail métier difficiles dans le modèle vocal. Pour un raisonnement plus approfondi et une utilisation des outils, il délègue à un backend sélectionné par le développeur. OpenAI donne des exemples tels que l'utilisation d'un modèle plus petit comme Luna pour la planification de gros volumes ou les mises à jour de commandes et un modèle comme Astra pour les problèmes clients complexes. Avec la délégation client, le backend n'a pas besoin d'être un modèle OpenAI.
Pour connaître les faits exacts sur API, les liens d'accès actuels et les sources des fournisseurs, consultez le nouveau Page modèle GPT-Live 1 dans la bibliothèque de modèles de Cody.
Pourquoi la voix en full duplex est différente
La plupart des gens ne parlent pas en blocs alternés et nets. Nous faisons une pause pour réfléchir sans abandonner la parole. Nous disons « bien » pendant que quelqu'un d'autre parle pour montrer que nous le suivons. Nous commençons une correction avant que l’autre personne ne termine. Un système tour par tour doit deviner si chaque silence ou son signifie « répondre maintenant », « continuer à écouter » ou « arrêter de parler ».
Duplex intégral signifie que le système peut écouter pendant qu'il parle. Cela ne garantit pas en soi une conversation naturelle, mais cela donne au modèle le contexte acoustique nécessaire pour réagir au chevauchement au fur et à mesure qu'il se produit. Un bref accusé de réception peut être traité différemment d’une véritable interruption. Une pause réfléchie peut rester une pause au lieu de devenir une invitation pour l’assistant à intervenir.
C’est également la raison pour laquelle un simple chiffre « heure du premier audio » ne peut pas décrire l’expérience dans son ensemble. Un agent vocal peut commencer à parler rapidement tout en se sentant impoli s'il interrompt un utilisateur qui réfléchit. Il peut avoir une bonne qualité vocale tout en restant lent s'il devient silencieux à chaque fois qu'un outil backend s'exécute. Le timing, la récupération, le comportement en cas de bruit de fond et l’achèvement des tâches comptent tous ensemble.
Comment fonctionne la délégation GPT Live 1
La délégation sépare le frontend vocal de l'agent backend. GPT-Live 1 peut maintenir la conversation en mouvement (en reconnaissant la demande ou en demandant un suivi utile) pendant qu'un travail plus approfondi se déroule ailleurs. OpenAI documente deux façons de connecter ce travail.
Délégation des réponses
Avec Délégation des réponses, GPT-Live 1 prépare la requête backend, envoie le contexte de conversation pertinent au modèle de réponses OpenAI choisi pour la session et ramène le résultat dans la conversation parlée. Il s’agit de la voie la plus gérée et du point de départ le plus facile lorsqu’un modèle Responses et ses outils pris en charge conviennent.
Le choix du backend est indépendant du modèle vocal. Une équipe peut acheminer le travail de routine vers un modèle plus rapide ou moins coûteux et réserver un raisonnement plus poussé aux cas qui le justifient. Cela signifie également que la qualité et le coût total d'un agent GPT-Live 1 dépendent en partie de la configuration du backend, et pas seulement du frontend vocal.
Délégation client
Avec délégation client, l'application reçoit un événement de délégation, assemble la transcription et le contexte métier appropriés, appelle n'importe quel modèle, agent, service ou flux de travail personnalisé, puis décide du résultat à renvoyer. Cette voie ajoute du travail d'ingénierie mais offre beaucoup plus de contrôle.
La délégation client est la meilleure solution lorsque les résultats doivent être validés ou rédigés avant d'être prononcés, que plusieurs backends nécessitent un routage personnalisé, que les systèmes privés doivent rester à l'intérieur d'un harnais d'agents existant ou qu'une équipe a besoin de ses propres budgets, points de contrôle et logique de secours.
Dans les deux modes, l'application (et non GPT-Live 1) reste responsable des autorisations, des confirmations, des enregistrements commerciaux et de l'état durable des tâches. La délégation est un mécanisme de communication, pas un système d'autorisation.
Fonctionnalités GPT Live 1 qui comptent
- Écoute et parole simultanées : le modèle raisonne ensemble sur l'audio entrant et sortant au lieu de traiter chacun comme un tour isolé.
- Gestion des interruptions naturelles : il peut réagir différemment à un canal détourné, à une correction ou à une véritable tentative de prendre la parole.
- Raisonnement et outils délégués : un travail plus approfondi peut s'effectuer via un modèle de réponses sélectionné ou un backend géré par une application.
- Comportement vocal invité : les développeurs peuvent façonner le ton, le rythme, le style, les canaux de retour, le comportement d'interruption et le moment où le modèle doit déléguer.
- Transcriptions natives : Les transcriptions ASR et le texte de réponse sont disponibles à côté du flux audio.
- Prise en charge des caractères alphanumériques et des mots clés : OpenAI met en évidence une gestion plus efficace des noms, des codes et d'autres chaînes exactes, ainsi qu'une polarisation des mots clés.
- Gestion du silence et du bruit de fond : le modèle est conçu pour éviter de traiter chaque son ou pause comme une commande de réponse.
- Fiabilité pendant de longues sessions : OpenAI affirme avoir amélioré la rétention du contexte et la qualité des conversations lors d'interactions plus longues.
- Connexions du navigateur, du serveur et du téléphone : les chemins documentés incluent WebRTC, WebSockets, le contrôle de bande latérale et la téléphonie/SIP.
La page modèle répertorie également le streaming et les appels de fonctions comme pris en charge. Les sorties structurées, le réglage fin et les sorties prédites ne sont pas pris en charge pour GPT-Live 1.
Tarification GPT Live 1
Le tarif global est simple : 0,05 $ par minute pour la session vocale frontale. OpenAI facture à la seconde, donc une session de 61 secondes n'est pas arrondie à deux minutes complètes.
Combien coûte une session vocale
| Utilisation de la voix | Coût frontal GPT-Live 1 |
|---|---|
| 10 minutes | $0.50 |
| 30 minutes | $1.50 |
| 100 heures (6 000 minutes) | $300 |
| 1 000 heures (60 000 minutes) | $3,000 |
Ces exemples sont de simples multiplications de prix catalogue. Ils sont utiles pour estimer la couche de conversation, mais ils sont pas le coût total de fonctionnement d'un agent vocal.
Les coûts non inclus dans 0,05 $ par minute
- Le modèle backend qui effectue un raisonnement ou génère des résultats délégués.
- Outils payants tels que la recherche sur le Web ou d'autres services de fournisseurs.
- Frais d'opérateur de téléphonie, de numéro de téléphone, de SIP ou de plate-forme partenaire.
- Vos serveurs, stockage, surveillance, observabilité et infrastructure audio.
- Escalade humaine, revue de la qualité et opérations de support.
Une prévision réaliste est donc : minutes de session vocale + utilisation du backend + outils + téléphone/transport + coûts d'application. Capturez ces pièces séparément lors d'un pilote. Le coût par tâche terminée est souvent plus utile que le coût par minute, car un appel plus naturel peut être résolu plus rapidement ou encourager une conversation plus longue.
La page de modèle de OpenAI mesure les limites de débit dans les sessions simultanées. Il répertorie actuellement 25 sessions pour le niveau 1, 50 pour le niveau 2, 200 pour le niveau 3, 300 pour le niveau 4 et 500 pour le niveau 5. Les équipes de production doivent confirmer les limites actuelles et demander de la capacité avant un lancement à grande échelle.
GPT Live 1 contre GPT-Realtime-2.1
Les deux sont des modèles vocaux OpenAI, mais ils résolvent l'architecture différemment. GPT-Realtime-2.1 est un modèle de raisonnement parole-parole qui peut recevoir du texte, des images et du contexte audio et appeler des fonctions au sein d'une session en temps réel. GPT-Live 1 est une interface de conversation en duplex intégral dédiée qui délègue un raisonnement et des actions plus approfondis à un backend distinct.
| Question | GPT-Live 1 | GPT-Realtime-2.1 |
|---|---|---|
| Conception de base | Frontend vocal en duplex intégral et backend délégué | Modèle de synthèse vocale en temps réel avec raisonnement et appel de fonctions dans la session |
| Facturation publiée | 0,05 $ par minute de session, plus l'utilisation du backend | Basé sur des jetons : les débits audio, texte et image varient selon la classe d'entrée/sortie |
| Comportement vocal | Conçu autour de l’écoute et de la parole simultanées | Dialogue en temps réel avec détection de virage et gestion des interruptions |
| Entrée frontale | Texte et audio | Texte, image et audio |
| Flexibilité du back-end | Modèle de réponses ou tout modèle, agent ou service exploité par le client | Un modèle temps réel configuré et ses outils disponibles |
| La meilleure raison de tester | Chevauchement plus naturel et routage back-end indépendant | Une session multimodale unifiée en temps réel avec une utilisation basée sur des jetons |
Les lignes de prix ne peuvent pas être converties en un verdict juste et universel de « modèle moins cher ». GPT-Live 1 facture le temps de session écoulé et ajoute une facture backend. GPT-Realtime-2.1 facture des jetons sur plusieurs classes multimédias. Le silence, le taux de parole, la longueur de réponse, l'utilisation de l'image, les outils, la mise en cache et le choix du backend modifient tous le résultat.
Utilisez la bibliothèque de modèles de Cody pour inspecter le courant Comparaison entre GPT-Live 1 et GPT-Realtime-2.1 ou comparez le GPT-Live 1 avec les autres modèles de la catégorie voix et temps réel.
GPT Live 1 par rapport à un pipeline STT-LLM-TTS traditionnel
Un agent vocal traditionnel connecte généralement trois systèmes : la parole-texte, un modèle de langage et la synthèse vocale. Cette modularité est précieuse. Les équipes peuvent choisir le meilleur modèle de transcription pour une langue, valider une réponse textuelle complète avant le début de la parole et remplacer un composant sans tout remplacer.
Le compromis est l’orchestration. Chaque transfert crée une autre file d'attente, une autre conversion de format et un autre endroit où le timing ou le contexte peuvent être perdus. L'application doit décider quand un énoncé se termine, que faire si l'appelant interrompt la parole synthétisée et comment la transcription doit changer après une autocorrection.
GPT-Live 1 regroupe les étapes d'écoute et de parole en une seule couche vocale continue tout en préservant un backend séparé pour un travail plus approfondi. Cela peut simplifier le tour de rôle et réduire la sensation de « talkie-walkie », mais cela n’élimine pas le besoin d’une couche d’application. L'application doit toujours gérer les actions, la confidentialité, la récupération après panne, la téléphonie et la source de vérité pour la tâche.
Choisissez en fonction de l'exigence la plus difficile. Si une validation complète avant la parole et un contrôle au niveau des composants sont obligatoires, un pipeline en cascade peut rester intéressant. Si le flux de conversation, le chevauchement et la poursuite de l'engagement pendant l'exécution d'une tâche sont essentiels, GPT-Live 1 est une architecture convaincante à tester.
Ce que font et ne prouvent pas les benchmarks de OpenAI
OpenAI rapporte que GPT-Live 1 a amélioré son résultat Full Duplex Bench en 30 points de pourcentage par rapport à GPT-Realtime-2.1, avec des gains en termes de latence de tour de rôle et de comportement interactif. Associé à GPT-6 Astra avec un effort de raisonnement moyen, OpenAI rapporte également un résultat Tau3 numéro un pour les tâches d'agent vocal de bout en bout.
Lors d'une première évaluation client, la société d'apprentissage des langues Speak a signalé près de 80 % d'interruptions en moins pendant les pauses de réflexion des apprenants par rapport à ses précédents systèmes au tour par tour. OpenAI a également publié des comptes clients favorables de Yelp, Fin, Cognition et autres.
Ces résultats sont des signaux utiles, mais ils restent évaluations publiées par le fournisseur et rapports clients. Le résultat Astra mesure un système combiné, et non GPT-Live 1 seul. Aucun des chiffres ne garantit les performances de votre opérateur téléphonique, les accents, le bruit, la latence des outils, les invites ou le flux de travail professionnel. Nous ne les avons pas reproduits comme benchmark Cody.
Une évaluation solide doit noter au moins : les tâches terminées, les interruptions inappropriées, la récupération après les corrections, le timing de fin de tour, la précision des outils, les centiles de latence, la qualité de l'escalade, le coût par tâche terminée et la préférence humaine lors des appels représentatifs.
Prise en charge des voix et des langues GPT Live 1
Le lancement de OpenAI répertorie douze voix : Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta et Cinder. La société affirme que la sélection étend la couverture aux accents, aux dialectes et aux langues et prévoit d’en ajouter davantage au fil du temps.
OpenAI ne publie pas une liste exacte de langues sur la page du modèle GPT-Live 1. Une « disponibilité linguistique plus large » ne doit donc pas être interprétée comme une garantie pour chaque modèle de langue, d'accent ou de changement de code. Testez de vrais locuteurs, les conditions de base, les noms, les adresses, les phrases de confirmation et les langues que votre produit promet de prendre en charge.
L'accès vocal personnalisé n'est pas une option libre-service par défaut. OpenAI demande aux organisations intéressées de contacter le service commercial pour connaître l'éligibilité et le processus de demande.
Comment connecter GPT Live 1
OpenAI documente plusieurs modèles de connexion. Le bon dépend de l'origine de l'audio et du système qui doit contrôler la session.
WebRTC pour les applications vocales du navigateur
WebRTC est le point de départ recommandé pour les applications vocales basées sur un navigateur. Les pistes multimédias transportent l'audio du microphone et du haut-parleur, tandis qu'un canal de données transporte les événements de session. Un serveur de confiance doit créer la session et conserver la clé OpenAI API hors du navigateur.
WebSockets pour l'audio côté serveur
Les WebSockets s'adaptent aux intégrations côté serveur où l'application possède le flux audio. La prise principale transporte les événements audio et de contrôle. Si le navigateur possède la connexion WebRTC mais que le serveur a toujours besoin de transcriptions, de surveillance ou d'instructions correctives, une bande latérale WebSocket peut attacher des contrôles de serveur sans éloigner l'audio de WebRTC.
Téléphonie et SIP pour les agents téléphoniques
OpenAI documente les chemins d'intégration de téléphonie et SIP et fournit des conseils aux partenaires pour les systèmes tels que LiveKit, Twilio, Telnyx, Daily et Pipecat. Les frais de l'opérateur et du partenaire restent distincts des frais de session GPT-Live 1.
Un plan d'installation pratique du GPT Live 1
- Choisissez un appel restreint. Commencez par un flux de travail limité, tel que vérifier une commande, qualifier un prospect ou trouver un rendez-vous, et non par un agent polyvalent.
- Choisissez la connexion. Utilisez WebRTC pour un prototype de navigateur, WebSockets lorsqu'un serveur possède l'audio ou un itinéraire téléphonique documenté pour les appels téléphoniques.
- Gardez l’invite en direct courte. Mettez le ton, le rythme, le style d’interruption, les canaux de retour et la politique de délégation dans l’invite vocale. Conservez les flux de travail commerciaux détaillés et les règles des outils dans le backend.
- Sélectionnez la délégation. Commencez par la délégation de réponses pour un backend OpenAI géré. Utilisez la délégation client lorsque vous avez besoin d'un contexte personnalisé, d'une validation, d'un routage ou d'un service non OpenAI.
- Appliquez les règles d’action dans le code. Vérifiez l'identité, l'autorisation, les confirmations, les budgets et les changements d'état autorisés avant l'exécution d'un outil.
- Conservez les transcriptions et l’état des tâches. Les deltas de transcription peuvent être incomplets ou erronés. Stockez suffisamment d’historique pour comprendre « oui », « vendredi à la place » et les corrections qui font référence à des détails antérieurs.
- Testez un son désordonné. Incluez les penseurs lents, les interruptions, les conversations parallèles, le bruit, l’orthographe, les numéros de compte, le silence, les déconnexions et la transmission à un humain.
- Mesurez le système complet. Suivez à la fois la qualité des conversations et la réussite des tâches back-end, ainsi que tous les coûts qui se situent en dehors du tarif à la minute vocale.
Migration depuis Realtime ou une pile vocale en cascade
La migration ne consiste pas simplement à modifier l'ID du modèle. Le changement le plus important consiste à diviser intentionnellement les responsabilités.
- Déplacez le style de conversation vers l’invite Live. Définissez la manière dont la voix doit parler, attendre, accuser réception, interrompre et déléguer.
- Conservez les flux de travail détaillés dans le backend. Les règles métier, les schémas d'outils, la validation, les autorisations et les sorties longues appartiennent à l'agent qui effectue le travail.
- Adaptez-vous aux événements audio continus. Le GPT-Live 1 diffuse de l'audio en continu et présente des événements de session différents de ceux du API en temps réel ; ne supposez pas le même flux de validation et de déclenchement manuel.
- Traduisez les appels de fonction en délégation. L'interface Live demande de l'aide à un backend plutôt que d'émettre des arguments d'outil structurés ordinaires de la même manière qu'un texte ou un agent en temps réel.
- Conservez les garanties existantes. Conservez la surveillance, les blocs d’action, les confirmations, les enregistrements d’audit, les annulations et les escalades. Adaptez-les pour un modèle qui peut continuer à parler pendant l'exécution des contrôles.
Exécutez l’ancienne et la nouvelle architecture avec les mêmes scénarios enregistrés lorsque la politique le permet. Comparez les résultats d'un appel complet, pas une démo raffinée. Notre séparé guide sur la latence des agents vocaux explique pourquoi le transport, la transcription, le raisonnement, les outils et la lecture doivent être mesurés ensemble.
Mises en garde en matière de production à comprendre
Votre application est toujours propriétaire des décisions risquées
GPT-Live 1 peut rendre une conversation confiante ; qui ne prouve pas qu’une action extérieure a été autorisée ou réalisée. Vérifiez les autorisations et les confirmations requises avant de modifier un rendez-vous, de débiter une carte, d'exposer un relevé de compte ou d'annoncer un succès. Conserver l’état de la tâche source de vérité en dehors de la session vocale.
Une interruption n'est pas une annulation
Si un appelant dit « En fait, vendredi à la place » pendant qu'une recherche de jeudi est en cours, l'interruption de la parole n'annule pas cette recherche. L'application doit réviser la tâche active, invalider les confirmations obsolètes, annuler le travail lorsque cela est possible et empêcher qu'un résultat de jeudi soir soit annoncé comme étant actuel.
La parole continue modifie la conception du garde-corps
Un agent de texte peut terminer et valider une réponse complète avant de la montrer. GPT-Live 1 peut parler pendant que le travail backend ou les vérifications de stratégie se poursuivent. La rétention du résultat d’un outil ne garantit pas que l’interface vocale reste silencieuse. Surveillez à la fois les transcriptions et les actions, bloquez les outils dangereux dans le code de l'application et contrôlez la lecture lorsqu'une approbation préalable au discours est requise.
Certaines décisions nécessitent encore l'audio original
Un backend délégué ne reçoit pas automatiquement la forme d’onde brute. Si un flux de travail dépend de preuves acoustiques (un bip de messagerie vocale, la cadence du locuteur, la présence d'une deuxième personne ou un autre signal non textuel), acheminez l'audio d'origine vers un détecteur ou un réviseur approprié. Ne présumez pas qu’une transcription contient tous les signaux entendus par le frontend.
Qui devrait tester GPT Live 1 ?
GPT-Live 1 est particulièrement intéressant pour les produits où le timing des conversations fait partie du travail : support client, prise de rendez-vous, réservations de restaurants, cours de langue, qualification commerciale, accessibilité, travail mains libres et interfaces vocales collaboratives.
Cela est moins évidemment nécessaire pour la narration à sens unique, la transcription de fichiers, la simple synthèse vocale ou les flux de travail qui doivent valider chaque phrase complète avant qu'un audio puisse être lu. Des services vocaux spécialisés ou une pile en cascade peuvent offrir un contrôle plus direct dans ces cas.
La décision pratique n’est pas « GPT-Live 1 est-il le meilleur modèle vocal ? » C'est : La conversation en duplex intégral et un backend choisi séparément améliorent-ils suffisamment la réussite des tâches pour justifier l'architecture et le coût total ? Un pilote représentatif peut répondre à cette question ; un titre de référence ne le peut pas.
Questions fréquemment posées
Qu'est-ce que GPT Live 1 ?
GPT-Live 1 est le modèle vocal full-duplex du OpenAI pour les conversations en temps réel. Il écoute et parle en même temps, puis délègue un raisonnement plus approfondi et le travail sur les outils à un agent backend distinct.
Combien coûte GPT Live 1 ?
La session vocale frontale coûte 0,05 $ par minute et est facturée à la seconde. L’utilisation du modèle backend, les outils, la téléphonie, le stockage et l’infrastructure applicative coûtent plus cher.
Le GPT Live 1 est-il disponible maintenant ?
Oui. OpenAI a publié GPT-Live 1 dans le API le 10 septembre 2026. Son identifiant exact de modèle API est gpt-live-1. La page modèle de OpenAI indique que le niveau gratuit API n'est pas pris en charge.
Qu’est-ce que l’IA vocale full-duplex ?
Le duplex intégral signifie que le système vocal peut écouter pendant qu'il parle. Cela rend les discours superposés, les accusés de réception, les interruptions et les pauses naturelles plus faciles à gérer qu'un échange rigide d'un interlocuteur à la fois.
Quelle est la différence entre GPT Live 1 et GPT-Realtime-2.1 ?
GPT-Live 1 est une interface vocale full-duplex facturée à la minute qui délègue un travail plus approfondi à un modèle backend. GPT-Realtime-2.1 est un modèle parole-parole facturé par jeton qui gère l'audio, le raisonnement et les appels de fonctions au sein de sa session en temps réel.
GPT Live 1 peut-il appeler des outils ?
Oui, par délégation. La délégation des réponses utilise un modèle de réponses OpenAI sélectionné. La délégation client permet à l'application d'appeler un autre modèle, agent, service ou flux de travail personnalisé et de décider quel résultat vérifié revient.
L'interruption de GPT Live 1 annule-t-elle une tâche backend ?
Non. L’interruption de la parole n’annule pas automatiquement le travail backend. L'application doit décider si elle doit annuler, réviser ou supprimer un résultat obsolète.
GPT Live 1 prend-il en charge WebRTC, WebSockets et les appels téléphoniques ?
Oui. OpenAI documente WebRTC pour les applications vocales du navigateur, les WebSockets pour l'audio côté serveur, les contrôles de serveur en bande latérale et les chemins d'intégration de téléphonie ou SIP.
Quelles voix sont disponibles pour GPT Live 1 ?
Le lancement de OpenAI répertorie Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta et Cinder. L'accès vocal personnalisé nécessite un processus d'éligibilité et de vente.
Sources et méthodologie
Cet article a été vérifié par rapport au matériel OpenAI propriétaire le 11 septembre 2026. Les résultats de référence et les résultats des clients sont étiquetés comme rapportés par OpenAI plutôt que présentés comme des mesures Cody indépendantes.
- OpenAI : Annonce de lancement du GPT-Live 1 API
- OpenAI : page du modèle GPT-Live 1, prix, fonctionnalités et limites de tarif
- OpenAI : premiers pas avec GPT-Live
- OpenAI : guide d'invite GPT-Live
- OpenAI : délégation et outils GPT-Live
- OpenAI : conseils de migration pour GPT-Live
- OpenAI : tarification API
L'essentiel
GPT-Live 1 est plus qu'une nouvelle voix synthétique. Cela change la forme d'un agent vocal : un modèle full-duplex gère le rythme humain de la conversation, tandis qu'un backend choisi séparément gère le travail le plus dur.
Le prix de 0,05 $ par minute rend le frontend facile à estimer, mais le backend, les outils, le réseau téléphonique et l'application déterminent toujours la facture totale et une grande partie de la qualité des tâches. La prochaine étape la plus utile est un pilote restreint avec des interruptions, des corrections, du bruit et des autorisations réalistes, et non une démo scriptée propre.
Explorez le Guide des modèles GPT-Live 1, comparez-le directement avec GPT-Realtime-2.1, ou parcourez l'intégralité Répertoire des modèles d'IA vocale.


