Tous les articles
IA en temps réel

Comment fonctionnent réellement les expériences d'agents IA en direct : un guide de terrain

Un guide indépendant des fournisseurs pour les agents conversationnels en temps réel lors d'événements, dans les salles de formation et dans les espaces publics. Il existe une catégorie de produits d'IA qui ne se comporte en rien comme celle que la plupart des équipes ont créée. Il n'a pas de fenêtre de discussion, pas de bouton d'envoi et non… Lire la suite »

Par Om KamathTemps de lecture: 17 minutes
Un visiteur du salon parlant à un kiosque d'agent IA en direct montrant un orbe d'écoute lumineux

Un guide indépendant des fournisseurs pour les agents conversationnels en temps réel lors d'événements, dans les salles de formation et dans les espaces publics

Il existe une catégorie de produits d’IA qui ne se comporte en rien comme celui que la plupart des équipes ont construit. Il n'a pas de fenêtre de discussion, pas de bouton d'envoi et pas de patience. Quelqu’un s’approche, ouvre la bouche et l’horloge démarre. Si la réponse arrive en une demi-seconde, cela ressemble à une conversation. S'il atterrit dans les deux secondes, la personne qui se trouve là suppose qu'il est cassé et s'en va.

Il s'agit d'agents en direct : des systèmes vocaux en temps réel qui tiennent une conversation dans la même pièce ou lors du même appel qu'un être humain. Ils se présentent sur les stands des salons professionnels, lors des simulations de formation, sur les kiosques des musées, à la réception des hôtels et derrière les numéros de téléphone. Et ils échouent d’une manière qu’un chatbot textuel ne fait jamais.

Cet article explique comment fonctionne réellement cette catégorie. Il ne s'agit pas d'un argumentaire de produit ni d'une liste d'outils. C'est la réalité de l'ingénierie et de la conception : construire quelque chose qui doit répondre à un étranger en moins d'une seconde, dans une salle bruyante, sans seconde chance.

Ce que signifie réellement « Live »

La contrainte déterminante n’est pas l’intelligence. Il est temps.

En 2009, une équipe de linguistes dirigée par Tanya Stivers a publié une étude dans PNAS mesurer l'écart entre les locuteurs d'une conversation ordinaire dans dix langues sur cinq continents : anglais, japonais, danois, laotien, italien, coréen, néerlandais, tzeltal, yélî-dnye et ‡Ākhoe Hai||om. Le constat était remarquablement uniforme. Chaque langue présentait une distribution à un seul pic des décalages de réponse, le mode se situant entre 0 et +200 millisecondes et une médiane interlinguistique d'environ +100 ms.

C’est le chiffre par rapport auquel votre système est jugé. Non pas par un repère, mais par un système nerveux calibré sur celui-ci depuis l'enfance.

Personne ne s’attend à ce qu’une machine atteigne 100 ms. Mais la falaise perceptuelle est réelle et elle est bien documentée dans la pratique : vers 800 ms, une réponse commence à apparaître comme sensiblement retardée ; au-delà d'environ 1 500 ms, la plupart des gens concluent que quelque chose ne va pas et se répètent ou se désengagent. Dans un environnement en direct avec une personne physiquement debout devant un écran, ce seuil est plus strict que sur un téléphone, car il n'y a aucune attente ambiante de retard du réseau pour l'absorber.

Il ne s’agit pas d’une préférence subjective. Dans une étude aveugle indépendante de 178 participants sur les systèmes d'avatars en temps réel, la réactivité était le prédicteur le plus puissant de l'expérience utilisateur globale – une corrélation de Spearman de 0,697, devant la qualité visuelle. Les utilisateurs ne pouvaient pas vous dire quel modèle représentait le meilleur visage. Ils pourraient vous dire, immédiatement et de manière fiable, lequel se sentait vivant.

L'anatomie d'un agent en direct

Sous le capot, presque tous les agents en direct appartiennent à l’une des deux architectures suivantes.

Le pipeline en cascade enchaîne des modèles discrets : l'audio arrive, un modèle de synthèse vocale le transcrit, une certaine logique décide que l'utilisateur a fini de parler, un modèle de langage produit une réponse, un modèle de synthèse vocale synthétise l'audio et l'audio est lu. Chaque étape est échangeable, observable et réglable indépendamment. Chaque étape ajoute également de la latence.

Le modèle parole-parole effondre cette chaîne. L'audio entre dans un seul modèle multimodal et l'audio en sort, sans goulot d'étranglement de texte intermédiaire. C'est ce que proposent l'API Realtime de OpenAI et Gemini Live de Google. C’est plus rapide et cela préserve la prosodie – le ton, l’hésitation, l’emphase – qu’une transcription jette aux oubliettes. Cela vous donne également beaucoup moins de contrôle sur ce qui s’est passé au milieu, ce qui est important lorsque vous devez enregistrer, auditer ou contraindre un comportement.

La plupart des systèmes de production en 2026 sont hybrides : un modèle en temps réel gérant la surface conversationnelle, avec des appels d'outils dirigés vers des modèles plus lents et plus performants pour tout ce qui nécessite un travail réel.

Où passe le temps

Telnyx a publié une décomposition utile d'un tour de voix, comparant une pile étroitement colocalisée à une pile typique assemblée par des fournisseurs distincts dans des régions distinctes :

Scène Pile colocalisée Pile cousue typique
Réseau / transports 45 ms 150 ms
Parole en texte 100 ms 225 ms
Inférence LLM 225 ms 650 ms
Synthèse vocale 80 ms 185 ms
Total 450 ms 1 210 ms

Deux choses ressortent. Premièrement, le LLM est l'élément de campagne le plus important dans les deux colonnes - c'est pourquoi l'acheminement des virages conversationnels simples vers un modèle petit et rapide et la réservation d'un modèle plus grand pour un véritable raisonnement constituent l'optimisation la plus efficace disponible. Deuxièmement, la différence entre les deux colonnes ne réside pas dans l’intelligence. C'est de la géographie et de la plomberie. Les mêmes modèles, mal disposés, vous coûtent trois quarts de seconde.

Si vous ajoutez un visage rendu à cela, prévoyez 150 à 200 ms supplémentaires pour la génération d'avatar en plus et attendez-vous à ce que la couche visuelle ajoute son propre délai de connexion à la session avant l'apparition de la première image.

Le problème le plus difficile est de savoir quand parler

Demandez à tous ceux qui ont expédié un agent réel ce qui s'est cassé en premier, et ils ne diront pas le modèle de langage. Ils diront à tour de rôle.

Le système doit répondre à une question que les humains résolvent inconsciemment et que les machines résolvent mal : Cette personne a-t-elle fini de parler ou réfléchit-elle simplement ? Si vous vous trompez dans un sens, l'agent interrompt quelqu'un au milieu d'une phrase. Si l'autre se trompe, l'agent reste assis en silence pendant que la personne attend, puis les deux commencent à parler en même temps.

Il existe quatre grandes approches, et elles s’empilent plutôt que de se concurrencer.

1. Détection d'activité vocale (VAD)

Un petit modèle classe chaque image audio comme vocale ou non vocale. Silero VAD est la valeur par défaut quasi universelle. Le VAD est rapide, bon marché et robuste face au bruit de fond constant, mais il fonctionne uniquement sur l'audio. Il sait que le son s'est arrêté. Il ne sait pas si la phrase est terminée.

2. Point final

Logique qui regarde la transcription en streaming et décide que l'énoncé est terminé, généralement après un seuil de silence. Le problème est arithmétique : un délai de silence de 800 ms ajoute près d'une seconde complète à chaque réponse, avant le début de tout traitement. Sur une conversation de dix minutes, ce sont des minutes d'air mort que vous avez payées par configuration.

3. Détection de virage sémantique

Un petit classificateur lit la transcription partielle et prédit l'achèvement du tour à partir du sens plutôt que du silence. « Mon numéro de compte est quatre sept… » est évidemment incomplet ; "c'est tout, merci" ne l'est évidemment pas. LiveKit est livré avec un détecteur de virage à poids ouverts affiné à partir de Qwen2.5-0.5B-Instruct pour l'inférence CPU à faible latence, couvrant 14 langues. Pipecat maintient Smart Turn comme alternative ouverte. Parce que ces modèles peuvent commettre un virage avant le silence final s'écoule, ils récupèrent la taxe de point final.

4. Modèles de parole conversationnelle spécialement conçus

L’approche la plus récente transforme la détection en modèle de reconnaissance lui-même. Deepgram Flux, généralement disponible sous forme multilingue depuis avril 2026, rapporte une détection médiane de fin de tour à 260 ms avec un seuil configurable pour échanger la latence contre la précision, et revendique une réduction de 200 à 600 ms de la latence de réponse de l'agent par rapport au STT-plus-VAD conventionnel. Tavus adopte une approche similaire avec son modèle de flux conversationnel Sparrow, utilisant ensemble des indices lexicaux, sémantiques, prosodiques et acoustiques.

Approche Signal utilisé Latence ajoutée Échec caractéristique
VAD uniquement Énergie audio Égal au seuil de silence Coupe tous ceux qui s'arrêtent pour réfléchir
Point de terminaison STT Flux de transcription Modéré Idem, légèrement plus intelligent
Modèle sémantique Signification de la transcription partielle Faible ; peut anticiper le silence Faux commits sur des phrases incomplètes
STT conversationnel Audio + lexical + prosodique Le plus bas Moins de contrôle ; plus récent, moins testé au combat

L'interruption est une politique, pas un paramètre

L'intervention - permettant à l'utilisateur de couper l'agent au milieu d'une phrase - est généralement exposée comme un seul booléen. C’est une erreur, et c’est la cause la plus courante pour laquelle un agent « se sent mal » sans que personne ne puisse dire pourquoi.

Le problème est que tous les fichiers audio entrants ne signifient pas la même chose. Une taxonomie utile, adaptée du runbook d'interruption de Hamming, le divise en six classes :

Entrée Exemple Comportement correct
Véritable correction "Non, vendredi" Arrêtez-vous immédiatement, acceptez le nouveau tour, conservez le contexte de la tâche
Canal arrière "mm-hm", "ouais", "c'est vrai" Continuez à parler ; ne pas traiter comme une nouvelle intention
Bruit accidentel Clavier, CVC, conversation adjacente Ignorer et reprendre à partir d'un point sûr
Longue pause d'entité À mi-chemin d'un numéro de compte Attendez; ne répondez pas tôt
Délai de silence La personne s'est éloignée Réinviter une fois, puis réinitialiser
Escalade de sécurité "Je veux une personne" Arrêtez-vous et remettez-le immédiatement

L'échec qui érode le plus rapidement la confiance est le faux arrêt : un agent qui s'arrête au milieu d'une phrase parce que quelqu'un a dit « ok », puis traite « ok » comme une nouvelle question. Il se lit comme un agent qui n'écoute pas. Dans un environnement bruyant, où le VAD tire constamment sur le son ambiant, un environnement d'intervention naïf produira cela des dizaines de fois par heure.

Le correctif concerne la stratégie par type de message. Un message d'accueil doit pouvoir être interrompu après une courte période de grâce. Un menu doit accepter DTMF et la parole. La capture d’entité doit être patiente. Une divulgation légale ou une déclaration de consentement ne devrait pas du tout être interrompue. Un remplissage « laissez-moi chercher ça » devrait être annulable instantanément.

Où les agents en direct s'intègrent réellement

La version honnête de cette section inclut les endroits où le format ne rapporte pas son coût.

Paramètre Pourquoi le format convient Qu'est-ce qui casse réellement
Salons et conférences La nouveauté arrête la circulation piétonnière ; l'agent se qualifie pendant que le personnel est occupé ; capture ce que les gens demandent réellement Bruit ambiant proche de 80 dB ; Wi-Fi peu fiable sur le site ; les visiteurs arrivent en groupe et non seuls
Entraînement et répétition Répétitions illimitées d’une conversation difficile sans coût social ; notation cohérente ; le débriefing est le lieu où l'apprentissage se produit Le réalisme des scénarios est difficile ; les apprenants jouent avec le simulateur ; la qualité du retour compte plus que la simulation
Kiosques publics (musées, transports en commun, services civiques) Multilingue par défaut ; jamais fatigué; de véritables gains d’accessibilité pour les personnes ne pouvant pas utiliser un écran tactile Attentes en matière de confidentialité dans l'espace public ; vandalisme et abus; une longue disponibilité sans surveillance ; doit se dégrader gracieusement hors ligne
Réception & conciergerie Couvre les heures creuses et les débordements ; gère parfaitement les mêmes quinze questions Tout ce qui est intéressant est une exception ; le chemin d'escalade est l'ensemble du produit
Lignes téléphoniques Concurrence infinie ; aucune couche visuelle à restituer ; un transport mature et maîtrisé Exposition réglementaire ; latence de la porteuse ; les appelants raccrochent plus vite qu'ils ne s'éloignent
Surface de vente au détail Recherche et comparaison de produits en rayon Bruit, foule et forte tendance des gens à préférer un humain à trois mètres
Là où ça ne rentre pas Tout ce qui nécessite une lecture soutenue, une saisie de données précise, un examen de documents complexes ou une décision à laquelle le visiteur doit réfléchir pendant plus d'une minute. La conversation en direct est une mauvaise interface pour tout ce qui n’est pas conversationnel.
Une personne répétant une conversation avec un agent IA en direct sur un écran mural dans une salle de pratique calme

La formation est le cadre dans lequel les agents en direct sont le moins axés sur la nouveauté et le plus sur la répétition. Image générée avec GPT Image 2.

Un ordre au volant est un point de référence utile pour les contraintes décrites dans cet article : le bruit du moteur, une file d'attente derrière la voiture et un appelant qui se corrigera au milieu d'une phrase. Démo publiée par Deepgram.

Le modèle qui sépare les bons déploiements des démos

Dans chaque paramètre ci-dessus, les déploiements qui produisent des résultats partagent une propriété : l'agent fait quelque chose pendant la conversation plutôt que de seulement répondre aux questions.

Un agent de stand qui répond « à quoi sert votre produit » est une brochure parlante. Un agent de stand qui prend l'URL de l'entreprise d'un visiteur et produit une analyse d'une page à l'écran en soixante secondes a changé la transaction : le visiteur a désormais une raison de vous donner une adresse e-mail, et une raison de décrire ensuite son expérience à un collègue. Un agent de formation qui anime un jeu de rôle est utile ; un agent de formation qui se termine par un débriefing spécifique et noté est un produit.

La conversation est l'interface. L'artefact est la valeur.

La pièce est la partie la plus difficile

C'est la section qui est ignorée, et c'est celle qui détermine si la chose fonctionne ce jour-là.

Installation aérienne du matériel d'installation de l'agent IA en direct : panneau à écran tactile, microphone directionnel, haut-parleur USB, webcam, point d'accès cellulaire, câble Ethernet et support VESA.

La liste des pièces qui décide si le logiciel fonctionne ce jour-là. Le haut-parleur avec annulation matérielle de l’écho est la solution la moins chère pour le plus grand risque. Image générée avec GPT Image 2.

Bruit. Une salle d'exposition fonctionne suffisamment fort pour que la détection vocale à micro ouvert échoue plus souvent qu'elle ne réussit. Les réponses pratiques sont un microphone directionnel ou à formation de faisceaux, une fonctionnalité push-to-talk ou tap-to-talk et un texte de secours visible. Un haut-parleur de conférence USB avec suppression matérielle de l'écho acoustique est la solution la moins chère pour le plus grand risque, car sans cela, les haut-parleurs de l'écran renvoient dans le micro et l'agent s'interrompt.

Connectivité. Le Wi-Fi sur site est un jeu de pile ou face. Apportez un point d'accès cellulaire, connectez-y la machine via Ethernet et mettez en cache un ensemble de réponses prédéfinies afin que la boucle d'attraction et les réponses de base survivent à un abandon.

Hygiène des séances. Une réinitialisation matérielle entre les visiteurs n’est pas facultative. Personne ne devrait jamais voir l'adresse e-mail, le nom de l'entreprise ou la conversation de la personne précédente à l'écran. Créez un délai d'attente qui ramène l'affichage en mode attraction lorsque quelqu'un s'éloigne au milieu d'une phrase - ce qu'il fera constamment.

Limites de sessions. Les sessions en temps réel ont des limites de durée et elles sont supprimées. Créez une reconnexion qui comporte un bref résumé dans la nouvelle session, sinon l'agent oubliera le nom de quelqu'un au milieu d'une conversation, devant une foule.

Garde-corps. Un agent en direct ne doit jamais proposer de prix personnalisés, promettre un calendrier ou prendre un engagement. Tout ce qui prend la forme d’un accord est confié à un humain. Cela vaut la peine d'être appliqué dans l'invite du système et lors d'un contrôle post-génération, car l'échec est public et citable.

Devrait-il vous voir ?

Les caméras sont l’ajout le plus tentant et le plus dangereux d’un agent en direct.

Les applications véritablement utiles sont limitées : détecter que quelqu'un s'est approché et fait face à l'écran, afin que le système puisse se réveiller ; compter le nombre de personnes présentes pour pouvoir s'ajuster ; remarquer que quelqu'un a détourné le regard, pour pouvoir faire une pause ; et lire quelque chose qu'une personne tient délibérément – ​​un badge, une carte de visite, un téléphone affichant son site Web. Ce dernier est le plus fort, car il s’agit d’un opt-in explicite. « Tenez votre badge devant la caméra » est une instruction naturelle qui vous permet d'obtenir le nom d'une entreprise sans que personne ne le tape.

Deux choses qu'il ne devrait pas faire : commenter l'apparence de quelqu'un et reconnaître quelqu'un qui lui a rendu visite plus tôt. Les deux se lisent comme un truc de fête pendant deux secondes et comme une surveillance par la suite.

Il existe également un piège des coûts qui surprend les équipes en retard. Les API multimodales en temps réel sont facturées par tour en fonction du contexte de session accumulé. Avec une caméra en streaming continu, chaque image que vous avez déjà envoyée se trouve dans ce contexte et est refacturée à chaque tour suivant. Une séance de huit heures à caméra ouverte produit une facture véritablement alarmante. La réponse architecturale consiste à conserver la détection de présence locale – un modèle intégré à l'appareil tel que celui du MediaPipe. poser un repère ou repère de visage s'exécute hors ligne et instantanément - et n'ouvre la session payante en temps réel qu'une fois qu'une personne est réellement engagée. Envoyez des images avec parcimonie, peut-être une par seconde lorsqu'elles sont actives ou uniquement à la demande, et fermez la session durement lorsqu'elles quittent. En prime, le mode attractif ne coûte alors rien et ne nécessite aucun réseau.

Divulgation, consentement et nouvelles règles

Depuis le 2 août 2026, l’article 50 de la loi de l’UE sur l’IA s’applique. Cela exige que les systèmes d’IA interagissant directement avec des personnes physiques soient conçus de manière à ce que les personnes soient informées qu’elles interagissent avec l’IA, et que les contenus synthétiques ou manipulés soient divulgués clairement et dès la première exposition. Une organisation sans IA à haut risque peut toujours se conformer à ces obligations simplement en exécutant un agent conversationnel orienté client ou un présentateur synthétique. La Commission européenne a publié lignes directrices sur la manière dont les obligations s'appliquent.

Sur les lignes téléphoniques aux Etats-Unis, la situation est réglée depuis la décision de la FCC Arrêt déclaratoire de février 2024, qui a confirmé que les voix générées par l'IA comptent comme une « voix artificielle ou préenregistrée » sous le TCPA. Cela entraîne des exigences de consentement, d'identification, de divulgation et de désinscription, ainsi que des dommages-intérêts légaux qui commencent à 500 $ par violation.

Au-delà du cadre juridique, les pratiques qui perdurent dans un espace physique sont peu glamour :

  • Indiquez qu'il s'agit d'une IA dans la première phrase, pas dans un pied de page.
  • Mettez une signalisation visible sur toute installation avec une caméra ou un microphone.
  • Traitez les images de la caméra et jetez-les ; n'insistez pas et soyez capable de le dire honnêtement lorsque quelqu'un vous le demande.
  • Utilisez un indicateur matériel : un obturateur physique ou une LED qui s'allume uniquement pendant une session active.
  • Vérifiez le contrat du lieu. Certains accords de conférence restreignent l'enregistrement sur place, et « nous diffusons uniquement en streaming, pas en enregistrement » est une distinction que l'organisateur peut ne pas accepter.
  • Si vous capturez des visages ou des empreintes vocales dans une juridiction dotée d'une loi sur la confidentialité biométrique, obtenez d'abord un consentement écrit. Le BIPA de l'Illinois en particulier comporte un droit d'action privé.

Que mesurer

La plupart des déploiements d'agents en direct sont évalués sur les vibrations. L'instrumentation qui vous dit réellement quelque chose :

Métrique Pourquoi c'est important
Temps jusqu'au premier octet audio, p50 et p95 La médiane correspond à ce à quoi ressemble votre démo ; p95 est ce que ressentent vos utilisateurs. La latence de queue est le moment où les gens se désengagent.
Taux de fausses interruptions Bruit ou canaux arrière confondus avec un vrai virage. Le principal moteur de "ça se sent cassé".
Taux d'interruption manquée De vraies corrections ignorées. Cela amène les gens à se répéter et à abandonner.
Tours par session Les sessions à un tour signifient que l’ouverture a échoué. Les sessions de quinze tours peuvent signifier que l'agent ne résout rien.
Point d'abandon Où dans le flux les gens s'éloignent ou raccrochent. Généralement une invite spécifique.
Taux de remontée et qualité Le transfert est un succès, pas un échec, à condition que le transfert soit contextuel.
Journal des questions sans réponse Le résultat le plus précieux de tout déploiement public. Il s’agit d’une recherche de positionnement gratuite.

Enregistrez les deux côtés de l’audio sur une seule horloge. Sans horloge partagée, vous ne pouvez pas mesurer la latence réelle, mais uniquement ce que votre propre pile rapporte sur elle-même – et ces deux chiffres peuvent différer d'une seconde entière.

Une liste de contrôle avant le vol

Avant tout déploiement en direct, à peu près dans l'ordre où les choses se passent mal :

  1. Mesurez la latence de tour p50 et p95 à partir de l'audio enregistré, et non à partir de vos propres journaux.
  2. Testez avec un bruit de fond réel au volume réel de la salle.
  3. Testez l’intervention pour les six classes d’interruption séparément.
  4. Confirmez que la session est complètement réinitialisée entre les utilisateurs, y compris à l'écran.
  5. Confirmez que le délai d'attente du mode d'attraction se déclenche lorsque quelqu'un quitte le milieu d'une phrase.
  6. Tirez sur le câble réseau et confirmez que la panne est gracieuse.
  7. Confirmez que la reconnexion transporte le contexte après une session abandonnée.
  8. Essayez de demander à l'agent de proposer un prix, de promettre une date ou de dire quelque chose de citable.
  9. Vérifiez que la divulgation de l'IA a lieu lors du premier échange.
  10. Vérifiez que la signalisation, les indicateurs de caméra et l'histoire de conservation des données correspondent à ce que vous faites réellement.
  11. Ayez un rollback : un écran statique, un code QR et un humain.

L'essentiel

Les agents en direct ne sont pas des chatbots dotés d’un microphone connecté. L'interface de discussion cache la latence, l'ambiguïté et l'échec derrière une zone de texte que les gens sont prêts à attendre. Enlevez cela et chaque faiblesse de la pile devient un événement social se déroulant devant un étranger.

Les équipes qui réussissent optimisent les choses ennuyeuses : le modèle de tour de rôle, le microphone, le réseau, la réinitialisation, le transfert. Ils limitent le travail de l'agent et le confient plus tôt. Ils s'assurent que la personne repart avec quelque chose. Et ils considèrent l’intervalle de conversation de 200 millisecondes sur lequel chaque humain a été formé depuis sa naissance comme une spécification réelle – et non comme un plaisir.

Tout le reste est une démo.

Votre premier assistant est à quelques minutes

Mettez vos connaissances commerciales à profit.

Commencez avec un compte Cody gratuit. Ajoutez votre contenu, créez un assistant et partagez la première réponse utile dès aujourd'hui.