Ingénierie de contexte
La discipline qui consiste à décider ce qu'un modèle d'IA voit à chaque appel — instructions, données récupérées, mémoire, définitions d'outils, exemples — et comment les assembler de façon fiable à mesure que le workflow grandit.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
L'ingénierie de contexte est le travail de construire le prompt que le modèle voit réellement. Ce n'est pas de l'ingénierie de prompt au sens d'un ajustement ponctuel de formulation — c'est la discipline systématique d'assembler instructions, contexte récupéré, mémoire, exemples, définitions d'outils et historique de conversation en une entrée cohérente à chaque appel de modèle. C'est là que se décide l'essentiel de la qualité d'une IA en production.
Pourquoi c'est important
Le modèle est le même ; c'est le système autour du modèle qui fait que l'IA d'une équipe paraît affûtée et celle d'une autre paraît brouillonne. L'ingénierie de contexte est la grappe de décisions qui détermine si le modèle a ce qu'il lui faut pour bien répondre — conception du retrieval, stratégie de segmentation, forme de la mémoire, structure du prompt, sélection d'exemples, surface d'outils.
Concepts liés
Budget de contexte, Compaction, Politique de prompts, Persona IA, RAG.
Ressources connexes
Le nombre total de jetons dont un agent IA dispose pour les instructions, la mémoire, le contexte récupéré, l'historique de conversation et les résultats d'outils — et la façon dont ce budget est réparti entre eux.
Réduire l'historique de conversation d'un agent IA pour que le contexte le plus pertinent reste dans la fenêtre du modèle sans dépasser le budget de jetons — en résumant, en tronquant ou en abandonnant sélectivement des tours.
L'ensemble versionné et testé de règles et de gabarits qui gouvernent l'assemblage des prompts d'un workflow IA — instructions, exemples, mise en forme, patrons de refus, langage d'escalade.
Avant qu'un agent IA puisse être utile à quiconque, il doit être quelque chose — une identité cohérente qui tient face aux utilisateurs, aux sessions, aux pressions adversaires. C'est l'axe de recherche qui définit ce que cela signifie et comment maintenir cette stabilité.
Le patron où un agent IA récupère du contexte pertinent dans vos données avant de générer une réponse — au lieu de s'appuyer uniquement sur ce que le modèle a appris à l'entraînement.
Comment ça fonctionne
Composantes : un prompt système stable (personnalité, portée, patrons de refus), du contexte récupéré depuis un catalogue de données gouverné, la mémoire de travail et la mémoire épisodique pertinente, des exemples choisis par similarité avec la tâche courante, des définitions d'outils à portée limitée, et l'entrée de l'utilisateur elle-même. Chacune a son propre emplacement dans le budget de contexte ; chacune est testable ; chacune est versionnée.