Jetons (tokens)
L'unité dans laquelle les modèles lisent, écrivent et facturent — environ les trois quarts d'un mot en anglais — la monnaie de chaque fenêtre de contexte et de chaque facture d'IA.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
Les modèles ne traitent pas des mots ; ils traitent des jetons — des fragments courants de texte. « Understanding » peut faire deux jetons ; « the » en fait un. Règle utile : 1 000 jetons représentent environ 750 mots anglais. Le français consomme un peu plus de jetons pour le même texte.
Pourquoi c'est important
Les jetons sont l'unité de mesure de tout : la fenêtre de contexte est une limite de jetons, la latence croît avec les jetons générés, et la facture se calcule au million de jetons — les jetons d'entrée, de sortie et de lecture de cache ayant chacun leur tarif. Le travail sur les coûts en IA est surtout un travail sur les jetons.
Concepts liés
Fenêtre de contexte, Coût des LLM, Cache de prompts, Budget de contexte.
Ressources connexes
La quantité maximale de texte qu'un modèle peut considérer en un appel — instructions, documents, conversation et résultats d'outils se la partagent, mesurée en jetons.
La dépense totale en API de modèles de langage à l'échelle d'une organisation — jetons d'entrée, jetons de sortie, embeddings, affinage — et la pratique qui consiste à l'attribuer, l'optimiser et la budgéter.
Réutiliser le préfixe déjà traité d'un prompt d'un appel à l'autre — instructions système, définitions d'outils, longs documents — pour que le contexte répété coûte une fraction du plein prix et revienne plus vite.
Le nombre total de jetons dont un agent IA dispose pour les instructions, la mémoire, le contexte récupéré, l'historique de conversation et les résultats d'outils — et la façon dont ce budget est réparti entre eux.
Comment ça fonctionne
Le journal d'usage de chaque appel consigne les jetons entrants et sortants, par classe : entrée fraîche, entrée en cache, sortie, et jetons de raisonnement quand le modèle les expose. Ces comptes, multipliés par le prix au moment de l'appel, deviennent l'attribution de coût par workflow sur laquelle l'opération se gère.