Opérations

Cache de prompts

Réutiliser le préfixe déjà traité d'un prompt d'un appel à l'autre — instructions système, définitions d'outils, longs documents — pour que le contexte répété coûte une fraction du plein prix et revienne plus vite.

Principe directeur

L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.

Ce que c'est

Les fournisseurs mettent en cache l'état calculé d'un préfixe de prompt pour que les appels suivants qui le partagent évitent le recalcul. Anthropic expose des points de rupture cache-control explicites avec un TTL, les lectures de cache étant facturées environ au dixième du prix d'entrée ; OpenAI applique le cache automatiquement sur les préfixes répétés. Dans les deux cas, la partie stable du prompt cesse d'être facturée comme des jetons neufs.

Pourquoi c'est important

Les agents renvoient le même prompt système, la même personnalité et les mêmes définitions d'outils à chaque tour. Sur les longues sessions, ce préfixe répété domine la dépense et la latence. Avec le cache, le tour marginal coûte surtout ce qu'il contient réellement de nouveau.

Comment nous l'utilisons

Les points de rupture de cache se placent au préfixe stable des prompts d'agents dans notre pile, avec le TTL configuré par charge de travail. Les journaux d'usage consignent les lectures et les écritures de cache comme des classes de jetons à part entière, si bien que l'économie est mesurée dans le rapport de coûts plutôt que présumée.

Concepts liés

Coût des LLM, Budget de contexte, Ingénierie de contexte, Inférence par lots.

Ressources connexes