Effacement des résultats d'outils
Retirer la réponse d'un outil de la fenêtre de contexte de l'agent une fois qu'il l'a utilisée — pour garder le contexte léger dans les longs workflows multi-outils.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
L'effacement des résultats d'outils est une stratégie de compaction propre aux workflows d'agents riches en outils. Une fois que l'agent a lu la réponse d'un outil et agi en conséquence, la réponse brute est retirée de l'historique de conversation et remplacée par une courte note (« a appelé l'outil X, a utilisé le résultat pour faire Y »). Le contexte reste léger même après des dizaines d'appels d'outils.
Pourquoi c'est important
Les résultats d'outils — résultats de recherche, contenus de fichiers, réponses d'API — sont le plus gros contributeur au gonflement de la fenêtre de contexte dans les workflows d'agents. Un workflow qui appelle 20 outils et garde toutes leurs réponses brutes en contexte dépassera n'importe quel budget raisonnable. Effacer les résultats après usage est la façon la moins coûteuse de garder les longs workflows viables.
Concepts liés
Compaction, Budget de contexte, Ingénierie de contexte, Appel d'outils.
Ressources connexes
Réduire l'historique de conversation d'un agent IA pour que le contexte le plus pertinent reste dans la fenêtre du modèle sans dépasser le budget de jetons — en résumant, en tronquant ou en abandonnant sélectivement des tours.
Le nombre total de jetons dont un agent IA dispose pour les instructions, la mémoire, le contexte récupéré, l'historique de conversation et les résultats d'outils — et la façon dont ce budget est réparti entre eux.
La discipline qui consiste à décider ce qu'un modèle d'IA voit à chaque appel — instructions, données récupérées, mémoire, définitions d'outils, exemples — et comment les assembler de façon fiable à mesure que le workflow grandit.
Le mécanisme par lequel un modèle de langage invoque des fonctions externes — API, bases de données, exécution de code, retrieval — et en lit les résultats pour poursuivre son travail.
Comment ça fonctionne
Une fois l'appel d'outil complété et le résultat incorporé par l'agent, le runtime réécrit l'historique des messages pour résumer l'appel. Le résumé préserve le fait que l'outil a été appelé et ce que l'agent en a conclu ; il abandonne la charge utile verbeuse. Bien fait, l'agent ne s'en aperçoit pas ; mal fait, l'agent perd du contexte critique et redemande la même chose.