Cache de prompts
Réutiliser le préfixe déjà traité d'un prompt d'un appel à l'autre — instructions système, définitions d'outils, longs documents — pour que le contexte répété coûte une fraction du plein prix et revienne plus vite.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
Les fournisseurs mettent en cache l'état calculé d'un préfixe de prompt pour que les appels suivants qui le partagent évitent le recalcul. Anthropic expose des points de rupture cache-control explicites avec un TTL, les lectures de cache étant facturées environ au dixième du prix d'entrée ; OpenAI applique le cache automatiquement sur les préfixes répétés. Dans les deux cas, la partie stable du prompt cesse d'être facturée comme des jetons neufs.
Pourquoi c'est important
Les agents renvoient le même prompt système, la même personnalité et les mêmes définitions d'outils à chaque tour. Sur les longues sessions, ce préfixe répété domine la dépense et la latence. Avec le cache, le tour marginal coûte surtout ce qu'il contient réellement de nouveau.
Concepts liés
Coût des LLM, Budget de contexte, Ingénierie de contexte, Inférence par lots.
Ressources connexes
La dépense totale en API de modèles de langage à l'échelle d'une organisation — jetons d'entrée, jetons de sortie, embeddings, affinage — et la pratique qui consiste à l'attribuer, l'optimiser et la budgéter.
Le nombre total de jetons dont un agent IA dispose pour les instructions, la mémoire, le contexte récupéré, l'historique de conversation et les résultats d'outils — et la façon dont ce budget est réparti entre eux.
La discipline qui consiste à décider ce qu'un modèle d'IA voit à chaque appel — instructions, données récupérées, mémoire, définitions d'outils, exemples — et comment les assembler de façon fiable à mesure que le workflow grandit.
Soumettre de grands ensembles de requêtes de modèle via l'API asynchrone de traitement par lots d'un fournisseur — typiquement à environ la moitié du prix des appels interactifs — pour les charges IA qui n'ont pas besoin d'une réponse immédiate.
Comment nous l'utilisons
Les points de rupture de cache se placent au préfixe stable des prompts d'agents dans notre pile, avec le TTL configuré par charge de travail. Les journaux d'usage consignent les lectures et les écritures de cache comme des classes de jetons à part entière, si bien que l'économie est mesurée dans le rapport de coûts plutôt que présumée.