Opérations

Garde-fous

Les vérifications de sécurité et les applications de politiques qui entourent les entrées et les sorties d'un agent IA — filtres de contenu, contrôles de portée, caviardage des renseignements personnels, patrons de refus et validateurs d'appels d'outils.

Principe directeur

L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.

Ce que c'est

Les garde-fous sont la couche qui empêche un agent IA de faire ce qu'il ne devrait pas : divulguer des renseignements personnels, appeler des outils hors de sa portée, générer du contenu interdit, agir sur des données que l'utilisateur ne peut pas voir, dépasser les budgets de coût. Ils s'exécutent avant le modèle (garde-fous d'entrée), après le modèle (garde-fous de sortie) et autour des appels d'outils.

Pourquoi c'est important

Un modèle entraîné à être utile sera parfois utile dans la mauvaise direction. Les garde-fous sont la couche déterministe autour du modèle non déterministe qui attrape la mauvaise direction avant qu'elle ne sorte. Sans eux, chaque propriété de sécurité dépend du bon comportement du modèle — ce qui n'est pas une fondation que les équipes de production acceptent.

Comment ça fonctionne

Les garde-fous d'entrée (détection des renseignements personnels, filtrage des injections de prompt, vérifications de portée) contrôlent ce qui atteint le modèle. Les garde-fous de sortie (classificateurs de contenu, vérification des citations, validateurs de format structuré) contrôlent ce qui en sort. Les garde-fous d'appels d'outils (application des portées, validation des paramètres) contrôlent ce que l'agent fait. Des boîtes à outils open source comme NVIDIA NeMo Guardrails et Guardrails AI fournissent les patrons courants ; des garde-fous sur mesure s'écrivent par workflow.

Concepts liés

Gouvernance, Porte d'approbation, Registre d'outils MCP, Politique de prompts, Évaluation des traces.

Ressources connexes