Évaluations
De l'anglais « evals », pour évaluations — les cas de test et le harnais qui mesurent si un workflow d'IA fonctionne, avant et après chaque changement.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
Les évaluations sont la suite de tests de l'IA. Là où le logiciel traditionnel a des tests unitaires, des tests d'intégration et de la CI, les workflows d'IA ont des évaluations : un ensemble organisé d'entrées avec des sorties réputées bonnes (ou des grilles de notation), plus le harnais qui exécute les prompts, modèles, politiques de retrieval ou formes de workflow candidats contre ce jeu et note les résultats.
Pourquoi c'est important
Sans évaluations, chaque changement d'IA est un pari optimiste. Avec des évaluations, les changements passent la barre ou ne sont pas livrés. Cette discipline est ce qui sépare les équipes d'IA qui s'améliorent de façon prévisible de celles qui livrent des régressions et les découvrent par les plaintes des clients.
Concepts liés
Harnais d'évaluation, Évaluations de workflow, LLM comme juge, Portes de promotion, Évaluation des traces.
Ressources connexes
Le logiciel qui exécute un jeu d'évaluations contre une variante d'IA candidate et produit des scores — qualité, latence, coût, sécurité — pour les décisions de promotion.
Suites d'évaluation qui testent prompts, modèles, politiques de retrieval, code généré et structure de workflow contre des seuils de qualité, latence, coût, mémoire et sécurité avant promotion.
Utiliser un modèle de langage pour noter la sortie d'un autre selon une grille — calibré contre des évaluateurs humains pour rendre les scores dignes de confiance.
Les seuils qu'un changement candidat doit franchir avant d'atteindre la production — qualité, latence, coût, mémoire, sécurité — encodés pour que la porte soit appliquée par CI, pas par espoir.
Noter les traces des workflows IA — pas seulement les sorties finales — pour détecter les problèmes de qualité au niveau des étapes : mauvais retrievals, appels d'outils erronés, raisonnement peu fiable.
Comment ça fonctionne
Le jeu d'évaluations se construit à partir d'exemples en or (succès de production), de régressions (échecs de production), de cas adversariaux synthétiques et d'un jeu de calibration noté par des humains. Le harnais exécute les candidats en parallèle, note chacun sur la qualité, la latence, le coût et la sécurité, et produit un différentiel. Substrats courants : Inspect AI (UK AISI), OpenAI Evals, Promptfoo, plus des harnais maison.