Agents vocaux
Des agents IA à qui l'on parle — reconnaissance vocale (STT) en continu, un tour d'agent et synthèse vocale (TTS) en continu composés en une boucle en duplex intégral où interruptions et latence se mesurent en millisecondes.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
Un agent vocal est un pipeline temps réel : l'audio du microphone se diffuse vers la reconnaissance vocale, l'agent traite le tour transcrit, et la synthèse vocale rediffuse l'audio — avec interruption au vol (barge-in : l'appelant interrompt la lecture et l'agent s'arrête) et détection de fin de tour qui donnent l'impression d'une conversation. Deux architectures s'affrontent : les modèles parole-à-parole unifiés comme OpenAI Realtime, et les pipelines composés qui enchaînent un STT dédié, un agent LLM et un TTS dédié.
Pourquoi c'est important
La voix demeure le canal au plus fort volume dans bien des opérations, et son budget de latence est impitoyable : l'appelant attend le premier son en moins d'une seconde. Ce budget force des décisions d'architecture — diffusion en continu partout, découpage TTS à la phrase, gestion des interruptions — que le clavardage textuel n'affronte jamais.
Concepts liés
Mode WebSocket, Runtime agent, Garde-fous, Cycle de vie des tâches.
Ressources connexes
Un mode d'interaction où un client maintient une connexion WebSocket persistante avec la plateforme IA — pour le streaming à faible latence, la voix en temps réel, la collaboration multi-tours et la rétroaction d'outils en direct.
La couche d'exécution des agents événementiels : déclencheurs, routage, appels d'outils, état durable, approbations, reprises, traces et contrôles de déploiement — la substance de production derrière une UI de chat.
Les vérifications de sécurité et les applications de politiques qui entourent les entrées et les sorties d'un agent IA — filtres de contenu, contrôles de portée, caviardage des renseignements personnels, patrons de refus et validateurs d'appels d'outils.
Les états définis que traverse une tâche d'agent IA — reçue, en cours, en attente d'approbation, complétée, échouée, expirée — et les événements qui déclenchent chaque transition.
Comment nous le construisons
Un pipeline composé sur WebSockets : reconnaissance vocale en continu (STT temps réel de classe Deepgram) avec des seuils de fin de tour ajustés, le même runtime agent gouverné que le clavardage textuel — mêmes outils, mêmes permissions, mêmes traces — et une synthèse vocale en continu découpée à la phrase, avec interruption au vol qui annule la lecture dès que l'appelant parle. Garder la voix sur le même runtime évite que l'histoire d'évaluation et de gouvernance ne fourche par canal.