Garde-fous
Les vérifications de sécurité et les applications de politiques qui entourent les entrées et les sorties d'un agent IA — filtres de contenu, contrôles de portée, caviardage des renseignements personnels, patrons de refus et validateurs d'appels d'outils.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
Les garde-fous sont la couche qui empêche un agent IA de faire ce qu'il ne devrait pas : divulguer des renseignements personnels, appeler des outils hors de sa portée, générer du contenu interdit, agir sur des données que l'utilisateur ne peut pas voir, dépasser les budgets de coût. Ils s'exécutent avant le modèle (garde-fous d'entrée), après le modèle (garde-fous de sortie) et autour des appels d'outils.
Pourquoi c'est important
Un modèle entraîné à être utile sera parfois utile dans la mauvaise direction. Les garde-fous sont la couche déterministe autour du modèle non déterministe qui attrape la mauvaise direction avant qu'elle ne sorte. Sans eux, chaque propriété de sécurité dépend du bon comportement du modèle — ce qui n'est pas une fondation que les équipes de production acceptent.
Concepts liés
Gouvernance, Porte d'approbation, Registre d'outils MCP, Politique de prompts, Évaluation des traces.
Ressources connexes
La couche de politiques pour l'accès aux données, les permissions d'outils, les approbations humaines, les pistes d'audit, la rétention et les frontières de déploiement — encodée comme configuration que le runtime applique, pas comme document que le runtime ignore.
Un point d'un workflow d'IA où une action est suspendue jusqu'à ce qu'un humain la révise et l'approuve, la rejette ou la modifie.
Un catalogue gouverné d'outils — adossé au Model Context Protocol — avec schémas typés, portées de permissions, exigences d'approbation et pistes d'audit par invocation.
L'ensemble versionné et testé de règles et de gabarits qui gouvernent l'assemblage des prompts d'un workflow IA — instructions, exemples, mise en forme, patrons de refus, langage d'escalade.
Noter les traces des workflows IA — pas seulement les sorties finales — pour détecter les problèmes de qualité au niveau des étapes : mauvais retrievals, appels d'outils erronés, raisonnement peu fiable.
Comment ça fonctionne
Les garde-fous d'entrée (détection des renseignements personnels, filtrage des injections de prompt, vérifications de portée) contrôlent ce qui atteint le modèle. Les garde-fous de sortie (classificateurs de contenu, vérification des citations, validateurs de format structuré) contrôlent ce qui en sort. Les garde-fous d'appels d'outils (application des portées, validation des paramètres) contrôlent ce que l'agent fait. Des boîtes à outils open source comme NVIDIA NeMo Guardrails et Guardrails AI fournissent les patrons courants ; des garde-fous sur mesure s'écrivent par workflow.