Runtime agent

Compaction

Réduire l'historique de conversation d'un agent IA pour que le contexte le plus pertinent reste dans la fenêtre du modèle sans dépasser le budget de jetons — en résumant, en tronquant ou en abandonnant sélectivement des tours.

Principe directeur

L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.

Ce que c'est

La compaction est ce qu'un agent fait quand sa conversation accumulée, ses documents récupérés et ses résultats d'outils menacent de dépasser la fenêtre de contexte du modèle. Plutôt que d'échouer ou d'abandonner aveuglément les tours les plus anciens, l'agent réécrit ou résume des parties de l'historique pour préserver ce qui compte et écarter ce qui ne compte pas. L'objectif est de garder l'agent utile sur de longues tâches sans faire déborder la fenêtre.

Pourquoi c'est important

Les vrais workflows agents s'étendent souvent sur des dizaines de tours, plusieurs appels d'outils et de gros documents récupérés. Sans compaction, l'agent frappe une limite dure de jetons (et plante) ou brûle son budget sur de l'historique non pertinent (et se dégrade). Une bonne compaction fait la différence entre un agent qui soutient une tâche de plusieurs heures et un agent qui perd le fil après vingt minutes.

Comment ça fonctionne

Stratégies courantes : résumer les tours anciens dans un synopsis continu ; garder les tours récents mot pour mot ; abandonner les charges utiles des résultats d'outils une fois que l'agent les a utilisées (effacement des résultats d'outils) ; retenir sélectivement selon un score de pertinence ; basculer l'ancien contenu vers un index de retrieval séparé. Différentes stratégies conviennent à différentes charges de travail — les tâches de recherche exigent un long rappel historique ; les tâches d'opérations favorisent la récence.

Concepts liés

Budget de contexte, Ingénierie de contexte, Mémoire externe, Effacement des résultats d'outils.

Ressources connexes