Opérations

Jetons (tokens)

L'unité dans laquelle les modèles lisent, écrivent et facturent — environ les trois quarts d'un mot en anglais — la monnaie de chaque fenêtre de contexte et de chaque facture d'IA.

Principe directeur

L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.

Ce que c'est

Les modèles ne traitent pas des mots ; ils traitent des jetons — des fragments courants de texte. « Understanding » peut faire deux jetons ; « the » en fait un. Règle utile : 1 000 jetons représentent environ 750 mots anglais. Le français consomme un peu plus de jetons pour le même texte.

Pourquoi c'est important

Les jetons sont l'unité de mesure de tout : la fenêtre de contexte est une limite de jetons, la latence croît avec les jetons générés, et la facture se calcule au million de jetons — les jetons d'entrée, de sortie et de lecture de cache ayant chacun leur tarif. Le travail sur les coûts en IA est surtout un travail sur les jetons.

Comment ça fonctionne

Le journal d'usage de chaque appel consigne les jetons entrants et sortants, par classe : entrée fraîche, entrée en cache, sortie, et jetons de raisonnement quand le modèle les expose. Ces comptes, multipliés par le prix au moment de l'appel, deviennent l'attribution de coût par workflow sur laquelle l'opération se gère.

Concepts liés

Fenêtre de contexte, Coût des LLM, Cache de prompts, Budget de contexte.

Ressources connexes