Injection de prompt
L'attaque où du contenu non fiable — une page web, un courriel, un document récupéré — porte des instructions que le modèle prend pour celles de son opérateur, poussant un agent à divulguer des données ou à détourner ses outils.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
Les modèles de langage ne distinguent pas nativement les instructions des données : tout texte qui entre dans le contexte peut tenter de rediriger le modèle. L'injection directe vient de l'utilisateur ; l'injection indirecte se cache dans le contenu que l'agent lit — une page web, un courriel qu'on lui a demandé de résumer, un document dans l'index de retrieval. L'OWASP classe l'injection de prompt comme le premier risque des applications LLM (LLM01).
Pourquoi c'est important
Pour un chatbot, l'injection produit une mauvaise réponse. Pour un agent doté d'outils, elle produit des actions : exfiltrer des données par un appel d'outil, envoyer un courriel, modifier un enregistrement. La surface d'outils transforme une vulnérabilité textuelle en abus de capacités, et il n'existe aucun correctif complet — la défense est en couches, pas résolue.
Concepts liés
Garde-fous, Permissions d'outils, Porte d'approbation, Gouvernance.
Ressources connexes
Les vérifications de sécurité et les applications de politiques qui entourent les entrées et les sorties d'un agent IA — filtres de contenu, contrôles de portée, caviardage des renseignements personnels, patrons de refus et validateurs d'appels d'outils.
Un patron de workflow IA de production relié aux données, aux agents, aux évaluations et aux opérations.
Un point d'un workflow d'IA où une action est suspendue jusqu'à ce qu'un humain la révise et l'approuve, la rejette ou la modifie.
La couche de politiques pour l'accès aux données, les permissions d'outils, les approbations humaines, les pistes d'audit, la rétention et les frontières de déploiement — encodée comme configuration que le runtime applique, pas comme document que le runtime ignore.
Comment nous nous défendons
Une règle de politique que le runtime applique — le contenu non fiable n'est jamais des instructions — plus des permissions d'outils délimitées par agent où le refus l'emporte sur la demande, qui l'emporte sur l'autorisation, des portes d'approbation sur les écritures, des contrôles de sortie avec un interrupteur d'arrêt pour l'opérateur, et des traces qui rendent une tentative d'injection visible après coup.