Budget de contexte
Le nombre total de jetons dont un agent IA dispose pour les instructions, la mémoire, le contexte récupéré, l'historique de conversation et les résultats d'outils — et la façon dont ce budget est réparti entre eux.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
Un budget de contexte est la comptabilité explicite du nombre de jetons alloués à chaque usage dans un même appel de modèle : instructions système, personnalité persistante, mémoire utilisateur, documents récupérés, historique de conversation, définitions d'outils et sorties d'outils. Le total est borné par la fenêtre de contexte du modèle ; la répartition est bornée par ce dont l'agent a réellement besoin pour réussir.
Pourquoi c'est important
L'usage de jetons, c'est du coût et de la latence. Allouer 80 % du budget à un PDF récupéré de 50 pages et 20 % à la demande réelle de l'utilisateur, c'est payer pour du contexte que l'agent ne lit jamais. Allouer uniformément, c'est risquer de manquer le document sur lequel porte vraiment la question. Un budget explicite force la décision de conception et rend les régressions détectables.
Concepts liés
Ingénierie de contexte, Compaction, Mémoire externe, Coût des LLM.
Ressources connexes
La discipline qui consiste à décider ce qu'un modèle d'IA voit à chaque appel — instructions, données récupérées, mémoire, définitions d'outils, exemples — et comment les assembler de façon fiable à mesure que le workflow grandit.
Réduire l'historique de conversation d'un agent IA pour que le contexte le plus pertinent reste dans la fenêtre du modèle sans dépasser le budget de jetons — en résumant, en tronquant ou en abandonnant sélectivement des tours.
La mémoire qui vit hors de la fenêtre de contexte du modèle — dans une base de données, un magasin vectoriel ou un magasin de mémoire structuré — et qui est récupérée à la demande plutôt que transportée dans chaque appel.
La dépense totale en API de modèles de langage à l'échelle d'une organisation — jetons d'entrée, jetons de sortie, embeddings, affinage — et la pratique qui consiste à l'attribuer, l'optimiser et la budgéter.
Comment ça fonctionne
Nous déclarons des budgets par emplacement (système : N jetons, retrieval : M jetons, historique : K jetons). Le retrieval respecte son budget en limitant le top-k et la taille des segments. L'historique respecte le sien par compaction. Les définitions d'outils respectent le leur par filtrage de registre (ne montrer que les outils pertinents pour l'étape en cours) et par chargement différé des outils — l'agent démarre avec les noms d'outils et des descriptions d'une ligne, puis ne va chercher les schémas complets que pour les outils dont il a réellement besoin. Le budget lui-même fait partie de la configuration du workflow et ses changements passent par la porte des évaluations.