Évaluation des traces
Noter les traces des workflows IA — pas seulement les sorties finales — pour détecter les problèmes de qualité au niveau des étapes : mauvais retrievals, appels d'outils erronés, raisonnement peu fiable.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
L'évaluation des traces est l'évaluation au niveau des étapes plutôt qu'au niveau de la sortie. Là où une évaluation de base note « la réponse finale correspond-elle à la réponse de référence », l'évaluation des traces note « chaque étape du raisonnement a-t-elle tenu la route » — le retrieval a-t-il ramené les bons chunks, les appels d'outils avaient-ils les bons arguments, le raisonnement intermédiaire du modèle était-il sensé, s'est-il arrêté au bon moment.
Pourquoi c'est important
L'évaluation limitée aux sorties masque le comportement réel du workflow. Un agent peut obtenir la bonne réponse pour de mauvaises raisons (retrieval chanceux, correspondance d'outil accidentelle) et échouer de façon catastrophique au prochain cas qui n'a pas la même chance. L'évaluation des traces est la façon dont l'équipe comprend ce que le workflow fait réellement, pas seulement ce qu'il produit.
Concepts liés
Évaluations, Évaluations de workflow, LLM comme juge, Observabilité, Rejeu de traces.
Ressources connexes
De l'anglais « evals », pour évaluations — les cas de test et le harnais qui mesurent si un workflow d'IA fonctionne, avant et après chaque changement.
Suites d'évaluation qui testent prompts, modèles, politiques de retrieval, code généré et structure de workflow contre des seuils de qualité, latence, coût, mémoire et sécurité avant promotion.
Utiliser un modèle de langage pour noter la sortie d'un autre selon une grille — calibré contre des évaluateurs humains pour rendre les scores dignes de confiance.
Une visibilité au niveau des traces sur les appels de modèle, le retrieval, les outils, les décisions, les approbations, les coûts et les échecs — le substrat opérationnel que toute autre discipline (évaluations, optimisation, gouvernance) consulte.
Réexécuter de façon déterministe un workflow IA à partir de sa trace stockée — la primitive de débogage qui fait de « pourquoi l'agent a-t-il fait ça » une question qui a une réponse.
Comment ça fonctionne
Les traces de production sont échantillonnées et notées au niveau des étapes à l'aide de grilles ou d'un LLM comme juge avec calibration. Les étapes mal notées remontent comme régressions candidates même quand la sortie finale a réussi. Les mêmes traces alimentent le jeu de régression quand des grappes d'échecs deviennent répétables.