Tous les articles
IA en temps réel

Comparaison des agents d'appel téléphonique IA : latence, détection de virage et interruptions

Pourquoi tous les benchmarks publiés ne sont pas d'accord, combien vous coûte réellement la détection de virage et comment la mesurer vous-même. Voici deux faits sur les agents téléphoniques IA en 2026, tous deux bien documentés, tous deux vrais et apparemment incompatibles. Premier fait : Vapi cible p50 sous… Lire la suite »

Par Om KamathTemps de lecture: 17 minutes
Deux formes d'onde audio se faisant face sur un champ sombre avec un espace lumineux entre elles

Pourquoi tous les benchmarks publiés ne sont pas d'accord, combien vous coûte réellement la détection de virage et comment la mesurer vous-même

Voici deux faits sur les agents téléphoniques IA en 2026, tous deux bien documentés, vrais et apparemment incompatibles.

Premier fait : Vapi cible p50 sous 500 ms. Retell publie environ 600 ms. La page d'accueil de Bland indique 400 ms. Les tests ConversationRelay internes du Twilio rapportent une médiane de 491 ms.

Deuxième fait : une référence indépendante qui a composé ces plates-formes sur des lignes téléphoniques réelles et mesuré à partir de l'audio enregistré a trouvé des médianes comprises entre 1 296 ms et 1 740 ms – chaque plate-forme est deux à quatre fois plus lente que son propre chiffre publié.

Personne ne ment. Ils mesurent différentes choses, sur différents transports, avec différentes hypothèses sur le point de départ de l'horloge. Et jusqu'à ce que vous compreniez exactement ce que décrit chaque numéro, vous ne pouvez utiliser aucun d'entre eux pour choisir une plate-forme.

Cet article prend le problème de mesure au sérieux, met côte à côte les références publiées avec leurs méthodologies associées, explique pourquoi la détection de virage - et non le modèle de langage - est désormais la variable dominante, et se termine par un protocole pour produire des nombres auxquels vous pouvez réellement faire confiance.

Où passe le temps

Un appel vocal lors d'un appel téléphonique est une course de relais à cinq étapes, et le relais est lancé entre chaque paire de coureurs.

Barre de chronologie empilée abstraite montrant cinq segments de latence inégale traversant une ligne de seuil

Un tour de voix est une course de relais en cinq étapes. L'un d'eux est toujours beaucoup plus large que les autres. Image générée avec GPT Image 2.

Scène Pile colocalisée Pile cousue typique
Réseau / SIP 45 ms 150 ms
Parole en texte 100 ms 225 ms
Inférence LLM 225 ms 650 ms
Synthèse vocale 80 ms 185 ms
Total 450 ms 1 210 ms

Deux observations. Le LLM domine les deux colonnes - c'est pourquoi l'acheminement des virages conversationnels ordinaires vers un petit modèle rapide et l'escalade uniquement lorsque le raisonnement est véritablement nécessaire constituent le changement le plus puissant disponible pour la plupart des équipes. Et l'écart de 760 ms entre les colonnes ne constitue pas une différence dans la qualité du modèle. Il s'agit de la géographie, du nombre de sauts et du nombre de réseaux de fournisseurs distincts traversés par l'audio.

Ce que ce tableau laisse de côté, c'est l'étape qui coûte généralement le plus cher : décider que l'appelant a fini de parler. Cela se produit avant le démarrage du relais, et un seuil de point de terminaison mal configuré peut ajouter plus de retard que l'ensemble du pipeline en dessous.

Les benchmarks, avec leurs méthodologies attachées

Quatre études indépendantes ont publié des chiffres pour ces plateformes en 2026. Elles ne sont pas d’accord, inversant parfois complètement le classement. Les voici avec la méthodologie qui les a produits, car la méthodologie est le résultat.

Étude 1 : Appels téléphoniques réels, mesurés à partir de l'audio enregistré

L'évaluation publique la plus transparente sur le plan méthodologique a appelé l'agent de chaque plate-forme lors d'un appel téléphonique réel avec un robot appelant lisant un script fixe, a enregistré les deux côtés de l'appel sur une seule horloge et a localisé les limites de parole dans l'enregistrement à l'aide de Silero VAD avec un raffinement énergétique. Aucun horodatage signalé par la plateforme n’a été utilisé. 2 078 tours utilisables sur cinq plates-formes ; point final normalisé à 0,1 s lorsque configurable. La métrique est le temps écoulé jusqu'au premier octet audio.

Plateforme p50 p95 Rapport de queue Tours utilisables
Telnyx 1 296 ms 1 856 ms 1.43× 419/432
ElevenLabs 1 424 ms 1 768 ms 1.24× 429/432
Bland AI 1 520 ms 2 248 ms 1.48× 429/432
Vapi 1 558 ms 2 008 ms 1.29× 382/432
Retell AI 1 740 ms 2 259 ms 1.30× 419/430

Notez la dernière colonne. Vapi a rejeté 50 tours, soit plus de dix pour cent, contre une poignée pour les autres. Une plate-forme qui ne parvient parfois pas à produire un tour utilisable vous dit quelque chose qu'aucun centile de latence ne capture.

Etude 2 : Appels de production, voix-voix

Une étude de mars 2026 a mené 500 appels de production par plateforme, mesurant la voix à voix.

Plateforme Médiane p95
Retell 680 ms 920 ms
Vapi 720 ms 1 050 ms
Bland 850 ms 1 180 ms

Retell termine dernier de l'étude 1 et premier de l'étude 2. Même plateforme, même année, conclusion opposée. C’est le point le plus important de cet article : dans l’état actuel de la technique, la méthode de mesure déplace le résultat plus que la plateforme.

Étude 3 : Pile tierce fixe

Une approche différente : maintenez les modèles constants (GPT-4.1, Deepgram Nova-3, ElevenLabs Flash) et mesurez le tour complet, en isolant la couche d'orchestration :

Plateforme Tour complet, p50
ElevenLabs 1,73 s
Retell 1,96 s
Vapi 2,34 s

Chaque chiffre ici est bien supérieur à ce qu'annonce n'importe quel fournisseur, car un tour complet sur une pile tierce fixe inclut les pièces que les fournisseurs excluent lorsqu'ils proposent leur propre chemin optimisé.

Etude 4 : La jambe porteuse seule

Enfin, un test réalisé en juin 2026 sur 120 appels sortants par opérateur en temps aller-retour isolé sur le tronçon téléphonie :

Transporteur p50 RTT p95 RTT
Telnyx 71 ms 118 ms
Twilio 89 ms 161 ms
Vonage 94 ms 152 ms

Contexte utile : le porteur contribue en dessous de 100 ms. Si votre agent se sent lent, le réseau téléphonique n’en est presque jamais la cause.

Quatre instruments de mesure différents encadrant différentes travées de la même barre lumineuse

Un objet, quatre instruments, quatre lectures. Chaque chiffre de latence présenté dans cet article est exact ; ils ne mesurent tout simplement pas la même portée. Image générée avec GPT Image 2.

Comment lire les quatre ensemble

Type de numéro Ce qu'il comprend Ce qu'il cache Faites-lui confiance pour
Réclamation p50 du fournisseur Chemin optimisé, souvent WebSocket pas de téléphonie Attente de point final, jambe porteuse, queue Qualité architecturale brute
Latence des composants (par exemple 75 ms TTS) Temps de synthèse d'un modèle Tout le reste Choisir ce composant
TTFAB audio enregistré Tout ce que l'appelant entend Rien, mais inclut les frais généraux d'enregistrement Classement de l'expérience réelle
Tour complet à pile fixe Frais généraux d'orchestration, isolés Les modèles optimisés pour chaque plateforme Comparaison des couches d'orchestration
Transporteur RTT Transport téléphonique uniquement L'agent entièrement Choisir un transporteur

Et les seuils qui comptent sur le plan perceptuel : le transfert de conversation humaine se situe à près de 200 ms ; au-delà d'environ 800 ms, l'appelant enregistre le retard ; au-delà d'environ 1 500 ms, le message est considéré comme cassé. Notez que la plupart des chiffres p95 de l’étude 1 se situent du mauvais côté de ce deuxième seuil. La médiane correspond à ce à quoi ressemble votre démo. Le p95 est ce que ressentent vos appelants.

La détection des virages est le véritable différenciateur

Chaque plate-forme ci-dessus peut appeler des modèles de classe GPT et diffuser des voix de classe ElevenLabs. Ce sont des marchandises. Ce qui différencie un agent naturel d'un agent épuisant, c'est la partie qui décide quand parler, et c’est là que résident désormais les véritables différences d’ingénierie.

La taxe de point final

L'approche naïve attend le silence. Définissez le seuil à 800 ms et vous avez ajouté près d'une seconde complète à chaque réponse avant le début de tout traitement. Sur un appel de dix minutes, c'est du véritable air mort, payé par une valeur de configuration. Abaissez le seuil et l'agent commence à interrompre toute personne qui prend une pause pour réfléchir, c'est-à-dire tout le monde, à mi-chemin d'un numéro de compte.

La pile qui le corrige

La détection de virage est la partie la moins glamour et la plus conséquente d'un agent vocal. La propre présentation par LiveKit de son modèle sémantique de fin d'énoncé est l'explication la plus claire et la plus courte de la raison pour laquelle un délai d'attente de silence n'est pas suffisant.
Couche Ce que ça fait Implémentations représentatives
VAD Classifie chaque image audio comme parole ou non Silero VAD — défaut quasi universel
Point de terminaison Surveille le flux de transcription pour les signaux d'achèvement Configuration du point de terminaison du fournisseur STT
Détection de virage sémantique Les prédictions détournent l'achèvement du sens, peuvent s'engager avant le silence LiveKit détecteur de virage (Qwen2.5-0.5B réglage fin, inférence CPU, 14 langues) ; Pipecat Virage intelligent
STT conversationnel Reconnaissance et tour de rôle en un seul modèle Deepgram Flux; Tavus Sparrow-1

Flux de Deepgram, généralement disponible sous forme multilingue depuis le 29 avril 2026 dans dix langues avec changement de langue en conversation, rapporte une détection médiane de fin de tour à 260 ms avec p95 à 1,5 s, expose un paramètre configurable. eot_threshold pour échanger la latence contre la précision et rapporte une latence de réponse de l'agent de réduction de 200 à 600 ms par rapport au STT-plus-VAD conventionnel. Tavus rapporte son modèle de flux Sparrow-1 avec une latence médiane de prévision du plancher de 55 ms.

Concrètement : passer d'un délai d'attente de silence de 800 ms à un détecteur de virage sémantique peut permettre d'économiser plus de latence que toutes les autres optimisations de cette page combinées. Si vous magasinez sur la latence, demandez quelle détection de tour la plate-forme utilise et si vous pouvez la modifier – cette réponse prédit votre expérience mieux que n'importe quel p50 publié.

Gestion des interruptions : une politique, pas une bascule

L'intrusion est généralement exposée sous la forme d'un booléen. Ce n’est pas la bonne forme pour le problème, et c’est la raison la plus courante pour laquelle un agent qui obtient de bons résultats en termes de latence se sent toujours mal à qui parler.

La raison en est que l’audio de l’appelant entrant n’est pas une chose. Une taxonomie utile le divise en six manières, chacune nécessitant un comportement différent :

Classe d'entrée Exemple Comportement correct Signal de panne
Véritable correction "Non, vendredi" Arrêtez-vous, acceptez le tour, préservez le contexte de la tâche L'appelant répète la même correction
Canal arrière "ouais", "mm-hm" Continuez à parler ; ne pas considérer comme une intention L'agent annule sa réponse et réinitialise
Bruit de fond Clavier, trafic, deuxième voix Continuez ; enregistrer une fausse interruption La lecture s'arrête sans transcription de l'appelant
DTMF L'appelant appuie sur 2 pendant un menu Itinéraire par chiffre, pas par transcription Chiffre ignoré ou traité comme parole
Longue pause d'entité Suspendre le numéro de compte à mi-chemin Attendez; ne répondez pas tôt L'agent interrompt avant que l'entité ne termine
Escalade "Je veux une personne" Arrêtez-vous et transférez immédiatement L'agent argumente

L'échec qui tue la confiance le plus rapidement est le faux arrêt : l'appelant dit « ok » alors que l'agent est au milieu d'une phrase, l'agent s'arrête, puis traite « ok » comme une nouvelle question. Lors d'un appel, c'est un problème. Sur des milliers d’appels, il s’agit d’une baisse mesurable du taux d’achèvement, et cela n’apparaît dans aucune mesure de latence.

La bonne structure est une politique par type de message. Salutations interrompues après un délai de grâce ; menus acceptant DTMF et parole ; entité capture le patient ; divulgations juridiques, de consentement et de paiement non-interruptible; remplissages d'attente d'outil annulables instantanément ; l’intention de transfert humain est toujours honorée.

Et instrumentez-le. Les quatre événements qui valent la peine d'être enregistrés à chaque tour sont le candidat à l'interruption, la décision et la version de politique qui l'a produit, la position de récupération et les faux positifs confirmés. Suivez le taux de fausses interruptions et le taux d’interruptions manquées dans des tableaux de bord distincts : ils évoluent dans des directions opposées et leur moyenne masque les deux. Il existe un pack de scénarios ouvert pour les tests d'intervention sur GitHub qui fonctionne sur Vapi, Retell, Bland, Pipecat et LiveKit auto-hébergé.

Les plateformes

Vapi

Vapi est la couche d'orchestration la plus flexible : apportez vos propres STT, LLM, TTS et téléphonie, échangez-les et ajustez le pipeline. Le prix est d'environ 0,05 $/min pour l'orchestration, chaque fournisseur sous-jacent étant facturé séparément. Des tests indépendants placent une pile optimisée à une médiane de 500 à 700 ms et le pipeline par défaut est considérablement plus lent. Choisissez-le lorsque vous souhaitez contrôler chaque composant et êtes prêt à posséder le réglage ; la flexibilité est réelle, tout comme la charge de configuration.

Retell AI

Retell est une pile gérée mettant l'accent sur les flux de dialogue structurés et la conformité de l'entreprise. Environ 0,055 $/min pour l'infrastructure vocale, avec un paiement à l'utilisation à partir d'environ 0,07 $/min. Signalé à environ 600 ms hors des sentiers battus dans une étude et à la dernière place dans une autre – voir la section ci-dessus. Choisissez-le lorsque vous souhaitez un pipeline géré pris en charge avec un contrôle de flux fort plutôt qu'un kit de composants.

Bland AI

Bland utilise une tarification groupée – parole-texte, LLM, synthèse vocale et téléphonie dans un tarif unique de 0,09 à 0,14 $/min – et spécialement conçue pour les volumes sortants élevés. Mesuré entre 700 et 900 ms en fonction de la complexité de la voie. Le bundle est vraiment plus simple à discuter commercialement ; le compromis est moins de contrôle sur chaque couche.

ElevenLabs Agents

Construit à partir de la synthèse vocale la plus appréciée de la catégorie, dont le modèle Flash synthétise en environ 75 ms. Les agents facturent environ 0,08 $/min sur les plans d'affaires annuels et environ 0,10 $/min sur Creator et Pro, avec des jetons LLM transmis séparément et des allocations de minutes regroupées sur chaque niveau. Jonction SIP connecte la téléphonie existante (Twilio, Telnyx, PBX auto-hébergé) avec une authentification Digest ou ACL et un outil de transfert vers un numéro prenant en charge les styles de conférence, aveugle et SIP REFER. Notamment, il a affiché le rapport de queue le plus serré dans la référence audio enregistrée, ce qui compte plus qu'une bonne médiane.

Telnyx

La propriété distinctive est l’intégration verticale : Telnyx possède le réseau de support sur lequel l'audio transite, et son budget d'architecture de 450 ms provient de la colocalisation de la pile plutôt que de modèles plus rapides. Il a affiché la médiane la plus basse dans l’étude sur les enregistrements audio et le RTT de transporteur le plus bas dans l’étude sur les transports. Choisissez-le lorsque le volet téléphonie est une préoccupation majeure.

OpenAI Realtime

Pas une plate-forme mais un modèle, et de plus en plus la chose sur laquelle les plates-formes sont construites. Le API en temps réel prend en charge trois transports : WebRTC pour les navigateurs, WebSocket pour les serveurs et SIP pour acheminer un véritable appel téléphonique directement vers une session. Il s'agit d'une synthèse vocale native : entrée audio, sortie audio, pas de goulot d'étranglement intermédiaire pour le texte et prosodie préservée tout au long du tour. La tarification est basée sur les jetons plutôt que sur la minute, ce qui produit une large plage efficace en fonction de votre discipline en matière de contexte et de mise en cache. Choisissez-le lorsque vous souhaitez la latence de tour la plus faible possible et pouvez créer l'orchestration environnante ; évitez-le lorsque vous devez enregistrer, auditer ou contraindre le raisonnement intermédiaire, car il n'y a aucun texte à inspecter.

Synthflow, Twilio ConversationRelay et le reste

Synthflow se situe autour de 0,09 $/min pour son moteur vocal avec un constructeur sans code destiné aux opérateurs plutôt qu'aux ingénieurs. Twilio ConversationRelay attache un agent IA au parc téléphonique existant du Twilio, avec des rapports internes de 491 ms p50 et 713 ms p95 – ce qui est intéressant si votre infrastructure d'appel y réside déjà.

Construisez-le vous-même : agents Pipecat et LiveKit

Les deux sont open source et tous deux sont véritablement viables en production.

Pipecat, créé par Daily, modélise un agent vocal comme un pipeline de processeurs à travers lequel circulent l'audio et le texte, avec une très grande bibliothèque de plugins et un développement quasi quotidien. Pipecat Cloud a atteint une disponibilité générale en 2026 après une version bêta avec plus d'un millier d'équipes, le chemin géré existe donc si vous le souhaitez.

Agents LiveKit est construit sur le serveur multimédia WebRTC de LiveKit, et sa particularité est le modèle de salle : l'agent rejoint en tant que participant aux côtés des utilisateurs, ce qui rend les scénarios multi-participants natifs plutôt que boulonnés. Une équipe a publiquement signalé avoir reconstruit un agent téléphonique de Pipecat vers des agents LiveKit lorsqu'un client est passé de 20 à 400 appels simultanés.

L’auto-hébergement peut atterrir bien en dessous de 0,05 $/min en volume. Vous échangez des frais de plateforme contre des travaux d'infrastructure, d'astreinte et de réglage de la latence, ce qui est un bon échange à grande échelle et un mauvais avant d'avoir trouvé l'adéquation produit-marché.

Ce que ça coûte réellement

L’erreur de budgétisation la plus courante dans cette catégorie consiste à comparer un tarif de plateforme uniquement à un tarif groupé.

Plateforme Tarif global Ce que cela couvre Un tout-en-un réaliste
Vapi 0,05 $/min Orchestration uniquement ~ 0,25 à 0,33 $/min une fois STT, LLM, TTS et la téléphonie ajoutés
Retell 0,055 $/min Infrastructure vocale À partir de ~0,07 $/min, paiement à l'utilisation
Bland 0,09 à 0,14 $/min Tout, regroupé À peu près le taux global
Synthflow 0,09 $/min Moteur vocal Plus LLM et téléphonie
ElevenLabs Agents 0,08 à 0,10 $/min Plateforme + voix Plus les jetons LLM transmis
OpenAI Realtime Basé sur des jetons Le modèle uniquement Très variable ; la mise en cache et la discipline contextuelle dominent
Auto-hébergé (Pipecat / LiveKit) Infrastructures Rien de groupé Peut descendre en dessous de 0,05 $/min en volume, plus le temps d'ingénierie

Points de référence des composants pour construire votre propre estimation : téléphonie autour de 0,014 $/min, diffusion de la parole en texte autour de 0,008 $/min, TTS premium autour de 0,05 $/min et petit LLM rapide autour de 0,01 $/min. Sur l’ensemble du marché, les tarifs complets en 2026 couvrent une fourchette d’environ six fois, d’environ 0,05 $/min sur les forfaits libre-service les plus agressifs à environ 0,31 $/min sur les niveaux entreprise premium.

Une remarque structurelle : la mise en cache des invites n'est pas une erreur d'arrondi sur un agent vocal. Les invites de votre système (personnage, garde-fous, règles métier, connaissances) sont identiques à chaque appel. Les entrées mises en cache sur les modèles en temps réel coûtent une petite fraction de l’entrée standard. L'activation de la mise en cache modifie fréquemment le coût du modèle d'un ordre de grandeur, et c'est la première chose à vérifier avant que quiconque ne propose de passer à un modèle moins bon pour économiser de l'argent.

La conformité n'est pas facultative ici

Les agents téléphoniques sont soumis à une exposition réglementaire que les agents de navigateur n'ont pas.

Aux États-Unis, la FCC Arrêt déclaratoire de février 2024 a confirmé que les voix générées par l'IA sont une « voix artificielle ou préenregistrée » sous le TCPA. Cela inclut les exigences de consentement pour les appels vers des lignes sans fil et résidentielles, les obligations d'identification et de divulgation et la gestion des désinscriptions – avec des dommages-intérêts légaux allant de 500 $ par violation, allant jusqu'à 1 500 $ pour les violations délibérées. Une nouvelle réglementation de la FCC sur les appels générés par l'IA devrait être conclue vers la fin de 2026 ou le début de 2027, et le résultat largement attendu est une exigence explicite d'identification de l'IA au début de l'appel ainsi qu'un langage de consentement qui nomme spécifiquement l'IA.

Dans l’UE, l’article 50 de la loi sur l’IA s’applique depuis le 2 août 2026 et exige que les personnes soient informées qu’elles interagissent avec l’IA. Au niveau des États américains, le Colorado AI Act entre en vigueur en 2026 et pourrait classer une grande partie de cette catégorie comme à haut risque.

La posture pratique est simple et ne vous coûte rien : divulguez dès la première ligne, conservez le registre de consentement, honorez immédiatement les désinscriptions et rendez le transfert humain toujours disponible. Chacun de ces éléments coûte moins cher à construire maintenant qu’à rénover.

Comparez-le vous-même

Étant donné que deux études crédibles ont inversé les mêmes classements, les seuls chiffres sur lesquels vous devriez agir sont les vôtres. Ce protocole prend une journée.

  1. Créez un script fixe. Vingt à trente tours couvrant votre cas d'utilisation réel, dont au moins un numéro long, une correction et une requête pour un humain.
  2. Enregistrez les deux jambes sur une seule horloge. N'utilisez pas les horaires indiqués par la plateforme ; ils excluent des parties du parcours vécu par votre appelant. Capturez l'audio de l'appel réel.
  3. Mesurer le temps jusqu'au premier octet audio à partir de la fin du discours de l'appelant, en utilisant un VAD sur l'enregistrement plutôt que le flux d'événements d'un fournisseur.
  4. Standardiser les points de terminaison sur chaque plate-forme que vous testez, ou vous évaluez la configuration plutôt que l'architecture.
  5. Déclarez p50 et p95 séparément, plus le rapport de queue et le nombre de tours que vous avez dû supprimer. Une plateforme qui ne produit parfois rien est pire qu’une plateforme qui est uniformément un peu plus lente.
  6. Exécutez les six classes d’interruption du tableau ci-dessus en tant que cas de test distincts, et notez indépendamment les faux arrêts et les arrêts manqués.
  7. Test sous charge. Chaque plateforme semble bonne sur un seul appel. La concurrence est l'endroit où les médianes se dégradent et les queues explosent.
  8. Test sur une mauvaise connexion et depuis un combiné mobile dans une voiture en mouvement, et non depuis un bureau connecté à la fibre optique.

L'essentiel

Les plates-formes de cette catégorie sont plus proches les unes des autres que ne le suggère leur marketing, et l'écart entre deux d'entre elles est plus petit que l'écart entre un déploiement bien réglé et un déploiement mal réglé de l'une ou l'autre.

Trois choses comptent plus que le fournisseur que vous choisissez. Détection de virage, car il s'agit de la plus grande tranche de latence récupérable et de la différence entre un agent qui se sent présent et un autre qui ressemble à une arborescence téléphonique. Politique d'interruption, car elle détermine si les appelants font confiance à la chose après le premier malentendu. Et la latence de queue, car votre p95 est ce que vos clients vivent réellement et c'est à peu près là qu'ils raccrochent.

Chaque vendeur vous montrera une médiane. Demandez le p95, demandez comment il a été mesuré, puis allez le mesurer vous-même.

Votre premier assistant est à quelques minutes

Mettez vos connaissances commerciales à profit.

Commencez avec un compte Cody gratuit. Ajoutez votre contenu, créez un assistant et partagez la première réponse utile dès aujourd'hui.