Évaluation

Évaluation des traces

Noter les traces des workflows IA — pas seulement les sorties finales — pour détecter les problèmes de qualité au niveau des étapes : mauvais retrievals, appels d'outils erronés, raisonnement peu fiable.

Principe directeur

L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.

Ce que c'est

L'évaluation des traces est l'évaluation au niveau des étapes plutôt qu'au niveau de la sortie. Là où une évaluation de base note « la réponse finale correspond-elle à la réponse de référence », l'évaluation des traces note « chaque étape du raisonnement a-t-elle tenu la route » — le retrieval a-t-il ramené les bons chunks, les appels d'outils avaient-ils les bons arguments, le raisonnement intermédiaire du modèle était-il sensé, s'est-il arrêté au bon moment.

Pourquoi c'est important

L'évaluation limitée aux sorties masque le comportement réel du workflow. Un agent peut obtenir la bonne réponse pour de mauvaises raisons (retrieval chanceux, correspondance d'outil accidentelle) et échouer de façon catastrophique au prochain cas qui n'a pas la même chance. L'évaluation des traces est la façon dont l'équipe comprend ce que le workflow fait réellement, pas seulement ce qu'il produit.

Comment ça fonctionne

Les traces de production sont échantillonnées et notées au niveau des étapes à l'aide de grilles ou d'un LLM comme juge avec calibration. Les étapes mal notées remontent comme régressions candidates même quand la sortie finale a réussi. Les mêmes traces alimentent le jeu de régression quand des grappes d'échecs deviennent répétables.

Concepts liés

Évaluations, Évaluations de workflow, LLM comme juge, Observabilité, Rejeu de traces.

Ressources connexes