Harnais d'évaluation
Le logiciel qui exécute un jeu d'évaluations contre une variante d'IA candidate et produit des scores — qualité, latence, coût, sécurité — pour les décisions de promotion.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
Un harnais d'évaluation est l'exécuteur : il prend un jeu d'évaluations, un candidat (un prompt, un modèle, un workflow, une politique de retrieval) et les grilles de notation, puis exécute l'évaluation en parallèle et émet un rapport structuré. La sortie est ce que l'équipe utilise pour décider si le candidat est meilleur que ce qui tourne en production.
Pourquoi c'est important
Construire un jeu d'évaluations est la moitié du travail. L'autre moitié est d'avoir un harnais qui l'exécute de façon fiable, en parallèle, avec une notation calibrée et une attribution correcte. Un excellent jeu d'évaluations avec un harnais capricieux produit des scores auxquels personne ne se fie.
Concepts liés
Évaluations, LLM comme juge, Portes de promotion, Évaluations de workflow, Inspect AI.
Ressources connexes
De l'anglais « evals », pour évaluations — les cas de test et le harnais qui mesurent si un workflow d'IA fonctionne, avant et après chaque changement.
Utiliser un modèle de langage pour noter la sortie d'un autre selon une grille — calibré contre des évaluateurs humains pour rendre les scores dignes de confiance.
Les seuils qu'un changement candidat doit franchir avant d'atteindre la production — qualité, latence, coût, mémoire, sécurité — encodés pour que la porte soit appliquée par CI, pas par espoir.
Suites d'évaluation qui testent prompts, modèles, politiques de retrieval, code généré et structure de workflow contre des seuils de qualité, latence, coût, mémoire et sécurité avant promotion.
Comment ça fonctionne
Il lit le jeu d'évaluations depuis le contrôle de version. Il lance des travailleurs parallèles qui appellent le candidat à travers la passerelle de la plateforme IA (pour que coût et latence reflètent la production). Il applique une notation par grille ou une notation LLM comme juge avec calibration humaine. Il émet un différentiel structuré contre la référence. Les portes de promotion consomment ce différentiel.