Évaluation

LLM comme juge

Utiliser un modèle de langage pour noter la sortie d'un autre selon une grille — calibré contre des évaluateurs humains pour rendre les scores dignes de confiance.

Principe directeur

L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.

Ce que c'est

Le LLM comme juge est la pratique d'utiliser un modèle pour évaluer les sorties d'un modèle. Un modèle juge lit une réponse candidate et une réponse attendue (ou une grille de notation), puis produit un score et une justification. C'est ainsi que les jeux d'évaluations passent à l'échelle au-delà de ce que des humains peuvent noter manuellement.

Pourquoi c'est important

La notation humaine est coûteuse et lente. Le LLM comme juge est économique et rapide — mais utile seulement si ses scores correspondent à ce qu'un humain attentif donnerait. C'est la calibration qui fait la différence. Un modèle juge en désaccord avec les humains 20 % du temps n'est pas un juge ; c'est un arbitre de départage qui a lui-même besoin d'une revue.

Comment ça fonctionne

Nous jumelons le juge à un petit jeu de calibration noté par des humains. Le juge le note ; nous mesurons l'accord (typiquement le kappa de Cohen ou un simple taux d'accord). Si l'accord est assez élevé, le juge sert sur le jeu d'évaluations plus large. Sinon, la grille est révisée ou un autre modèle juge est essayé. La calibration est relancée à chaque changement du jeu d'évaluations.

Concepts liés

Évaluations, Harnais d'évaluation, Évaluation des traces, Évaluations de workflow.

Ressources connexes