Évaluation

Harnais d'évaluation

Le logiciel qui exécute un jeu d'évaluations contre une variante d'IA candidate et produit des scores — qualité, latence, coût, sécurité — pour les décisions de promotion.

Principe directeur

L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.

Ce que c'est

Un harnais d'évaluation est l'exécuteur : il prend un jeu d'évaluations, un candidat (un prompt, un modèle, un workflow, une politique de retrieval) et les grilles de notation, puis exécute l'évaluation en parallèle et émet un rapport structuré. La sortie est ce que l'équipe utilise pour décider si le candidat est meilleur que ce qui tourne en production.

Pourquoi c'est important

Construire un jeu d'évaluations est la moitié du travail. L'autre moitié est d'avoir un harnais qui l'exécute de façon fiable, en parallèle, avec une notation calibrée et une attribution correcte. Un excellent jeu d'évaluations avec un harnais capricieux produit des scores auxquels personne ne se fie.

Comment ça fonctionne

Il lit le jeu d'évaluations depuis le contrôle de version. Il lance des travailleurs parallèles qui appellent le candidat à travers la passerelle de la plateforme IA (pour que coût et latence reflètent la production). Il applique une notation par grille ou une notation LLM comme juge avec calibration humaine. Il émet un différentiel structuré contre la référence. Les portes de promotion consomment ce différentiel.

Concepts liés

Évaluations, LLM comme juge, Portes de promotion, Évaluations de workflow, Inspect AI.

Ressources connexes