Runtime agent

Agents vocaux

Des agents IA à qui l'on parle — reconnaissance vocale (STT) en continu, un tour d'agent et synthèse vocale (TTS) en continu composés en une boucle en duplex intégral où interruptions et latence se mesurent en millisecondes.

Principe directeur

L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.

Ce que c'est

Un agent vocal est un pipeline temps réel : l'audio du microphone se diffuse vers la reconnaissance vocale, l'agent traite le tour transcrit, et la synthèse vocale rediffuse l'audio — avec interruption au vol (barge-in : l'appelant interrompt la lecture et l'agent s'arrête) et détection de fin de tour qui donnent l'impression d'une conversation. Deux architectures s'affrontent : les modèles parole-à-parole unifiés comme OpenAI Realtime, et les pipelines composés qui enchaînent un STT dédié, un agent LLM et un TTS dédié.

Pourquoi c'est important

La voix demeure le canal au plus fort volume dans bien des opérations, et son budget de latence est impitoyable : l'appelant attend le premier son en moins d'une seconde. Ce budget force des décisions d'architecture — diffusion en continu partout, découpage TTS à la phrase, gestion des interruptions — que le clavardage textuel n'affronte jamais.

Comment nous le construisons

Un pipeline composé sur WebSockets : reconnaissance vocale en continu (STT temps réel de classe Deepgram) avec des seuils de fin de tour ajustés, le même runtime agent gouverné que le clavardage textuel — mêmes outils, mêmes permissions, mêmes traces — et une synthèse vocale en continu découpée à la phrase, avec interruption au vol qui annule la lecture dès que l'appelant parle. Garder la voix sur le même runtime évite que l'histoire d'évaluation et de gouvernance ne fourche par canal.

Concepts liés

Mode WebSocket, Runtime agent, Garde-fous, Cycle de vie des tâches.

Ressources connexes