LLM comme juge
Utiliser un modèle de langage pour noter la sortie d'un autre selon une grille — calibré contre des évaluateurs humains pour rendre les scores dignes de confiance.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
Le LLM comme juge est la pratique d'utiliser un modèle pour évaluer les sorties d'un modèle. Un modèle juge lit une réponse candidate et une réponse attendue (ou une grille de notation), puis produit un score et une justification. C'est ainsi que les jeux d'évaluations passent à l'échelle au-delà de ce que des humains peuvent noter manuellement.
Pourquoi c'est important
La notation humaine est coûteuse et lente. Le LLM comme juge est économique et rapide — mais utile seulement si ses scores correspondent à ce qu'un humain attentif donnerait. C'est la calibration qui fait la différence. Un modèle juge en désaccord avec les humains 20 % du temps n'est pas un juge ; c'est un arbitre de départage qui a lui-même besoin d'une revue.
Concepts liés
Évaluations, Harnais d'évaluation, Évaluation des traces, Évaluations de workflow.
Ressources connexes
De l'anglais « evals », pour évaluations — les cas de test et le harnais qui mesurent si un workflow d'IA fonctionne, avant et après chaque changement.
Le logiciel qui exécute un jeu d'évaluations contre une variante d'IA candidate et produit des scores — qualité, latence, coût, sécurité — pour les décisions de promotion.
Noter les traces des workflows IA — pas seulement les sorties finales — pour détecter les problèmes de qualité au niveau des étapes : mauvais retrievals, appels d'outils erronés, raisonnement peu fiable.
Suites d'évaluation qui testent prompts, modèles, politiques de retrieval, code généré et structure de workflow contre des seuils de qualité, latence, coût, mémoire et sécurité avant promotion.
Comment ça fonctionne
Nous jumelons le juge à un petit jeu de calibration noté par des humains. Le juge le note ; nous mesurons l'accord (typiquement le kappa de Cohen ou un simple taux d'accord). Si l'accord est assez élevé, le juge sert sur le jeu d'évaluations plus large. Sinon, la grille est révisée ou un autre modèle juge est essayé. La calibration est relancée à chaque changement du jeu d'évaluations.