Fenêtre de contexte
La quantité maximale de texte qu'un modèle peut considérer en un appel — instructions, documents, conversation et résultats d'outils se la partagent, mesurée en jetons.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
Chaque appel de modèle a une limite dure sur la quantité de texte que le modèle peut lire d'un coup : la fenêtre de contexte. Les modèles de pointe actuels acceptent d'environ 200 000 à plus d'un million de jetons. Tout se dispute cet espace — le prompt système, les documents récupérés, l'historique de conversation, les définitions d'outils et les résultats d'outils.
Pourquoi c'est important
Une fenêtre plus grande n'est pas une stratégie. La remplir coûte argent et latence à chaque appel, et les modèles portent moins d'attention au milieu des très longs contextes. Les systèmes de production traitent la fenêtre comme un budget à allouer délibérément, pas comme un seau à remplir.
Concepts liés
Budget de contexte, Compaction, Jetons (tokens), Cache de prompts.
Ressources connexes
Le nombre total de jetons dont un agent IA dispose pour les instructions, la mémoire, le contexte récupéré, l'historique de conversation et les résultats d'outils — et la façon dont ce budget est réparti entre eux.
Réduire l'historique de conversation d'un agent IA pour que le contexte le plus pertinent reste dans la fenêtre du modèle sans dépasser le budget de jetons — en résumant, en tronquant ou en abandonnant sélectivement des tours.
L'unité dans laquelle les modèles lisent, écrivent et facturent — environ les trois quarts d'un mot en anglais — la monnaie de chaque fenêtre de contexte et de chaque facture d'IA.
Réutiliser le préfixe déjà traité d'un prompt d'un appel à l'autre — instructions système, définitions d'outils, longs documents — pour que le contexte répété coûte une fraction du plein prix et revienne plus vite.
Comment ça fonctionne
Les disciplines qui gèrent la fenêtre ont leurs propres entrées : un budget de contexte alloue les jetons par usage, la compaction réduit l'historique de conversation, l'effacement des résultats d'outils élimine les charges utiles épuisées, et le cache de prompts rend le préfixe stable peu coûteux à renvoyer.