Évaluation

Évaluations

De l'anglais « evals », pour évaluations — les cas de test et le harnais qui mesurent si un workflow d'IA fonctionne, avant et après chaque changement.

Principe directeur

L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.

Ce que c'est

Les évaluations sont la suite de tests de l'IA. Là où le logiciel traditionnel a des tests unitaires, des tests d'intégration et de la CI, les workflows d'IA ont des évaluations : un ensemble organisé d'entrées avec des sorties réputées bonnes (ou des grilles de notation), plus le harnais qui exécute les prompts, modèles, politiques de retrieval ou formes de workflow candidats contre ce jeu et note les résultats.

Pourquoi c'est important

Sans évaluations, chaque changement d'IA est un pari optimiste. Avec des évaluations, les changements passent la barre ou ne sont pas livrés. Cette discipline est ce qui sépare les équipes d'IA qui s'améliorent de façon prévisible de celles qui livrent des régressions et les découvrent par les plaintes des clients.

Comment ça fonctionne

Le jeu d'évaluations se construit à partir d'exemples en or (succès de production), de régressions (échecs de production), de cas adversariaux synthétiques et d'un jeu de calibration noté par des humains. Le harnais exécute les candidats en parallèle, note chacun sur la qualité, la latence, le coût et la sécurité, et produit un différentiel. Substrats courants : Inspect AI (UK AISI), OpenAI Evals, Promptfoo, plus des harnais maison.

Concepts liés

Harnais d'évaluation, Évaluations de workflow, LLM comme juge, Portes de promotion, Évaluation des traces.

Ressources connexes