Mémoire externe
La mémoire qui vit hors de la fenêtre de contexte du modèle — dans une base de données, un magasin vectoriel ou un magasin de mémoire structuré — et qui est récupérée à la demande plutôt que transportée dans chaque appel.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
La mémoire externe est tout ce dont un agent IA se souvient qui n'est pas dans sa fenêtre de contexte courante. L'historique de conversation plus vieux que la fenêtre, les préférences de l'utilisateur, les faits des sessions passées, le contexte organisationnel — tout est stocké à l'externe et récupéré quand c'est pertinent. Sans mémoire externe, un agent redémarre à froid à chaque session. Avec elle, un agent peut porter du contexte sur des jours ou des mois.
Pourquoi c'est important
Les fenêtres de contexte des modèles grandissent, mais restent finies, coûteuses et lentes à exploiter pleinement. La mémoire externe garde la charge par appel petite et le rappel à long terme grand. Le compromis, c'est la qualité du retrieval : un mauvais retrieval de mémoire peut être pire que pas de mémoire du tout (il fait remonter le mauvais précédent au mauvais moment).
Concepts liés
Mémoire agent, Budget de contexte, Compaction, Recherche vectorielle.
Ressources connexes
Comment un agent IA se souvient de l'utilisateur qu'il sert — ce qu'il a dit avant, ce qu'il préfère, le contexte à ne pas répéter — sans que cette mémoire dérive le comportement de l'agent pour tous les autres.
Le nombre total de jetons dont un agent IA dispose pour les instructions, la mémoire, le contexte récupéré, l'historique de conversation et les résultats d'outils — et la façon dont ce budget est réparti entre eux.
Réduire l'historique de conversation d'un agent IA pour que le contexte le plus pertinent reste dans la fenêtre du modèle sans dépasser le budget de jetons — en résumant, en tronquant ou en abandonnant sélectivement des tours.
Pipelines de retrieval qui combinent découpage, embeddings, filtrage par métadonnées, recherche hybride par mots-clés, reranking, permissions et évaluation — pas juste des lookups au plus proche voisin.
Comment ça fonctionne
Substrats courants : pgvector ou Qdrant pour la mémoire indexée par embeddings ; des magasins clé-valeur structurés pour les faits ; la recherche plein texte pour retrouver les conversations passées ; des récupérateurs hybrides qui combinent les trois. Chaque entrée de mémoire a une source, une confiance, une décroissance et une expiration. Au moment de l'inférence, le retrieval note les entrées selon la récence, la pertinence et la confiance.