Runtime agent

Fenêtre de contexte

La quantité maximale de texte qu'un modèle peut considérer en un appel — instructions, documents, conversation et résultats d'outils se la partagent, mesurée en jetons.

Principe directeur

L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.

Ce que c'est

Chaque appel de modèle a une limite dure sur la quantité de texte que le modèle peut lire d'un coup : la fenêtre de contexte. Les modèles de pointe actuels acceptent d'environ 200 000 à plus d'un million de jetons. Tout se dispute cet espace — le prompt système, les documents récupérés, l'historique de conversation, les définitions d'outils et les résultats d'outils.

Pourquoi c'est important

Une fenêtre plus grande n'est pas une stratégie. La remplir coûte argent et latence à chaque appel, et les modèles portent moins d'attention au milieu des très longs contextes. Les systèmes de production traitent la fenêtre comme un budget à allouer délibérément, pas comme un seau à remplir.

Comment ça fonctionne

Les disciplines qui gèrent la fenêtre ont leurs propres entrées : un budget de contexte alloue les jetons par usage, la compaction réduit l'historique de conversation, l'effacement des résultats d'outils élimine les charges utiles épuisées, et le cache de prompts rend le préfixe stable peu coûteux à renvoyer.

Concepts liés

Budget de contexte, Compaction, Jetons (tokens), Cache de prompts.

Ressources connexes