LiteLLM
Une bibliothèque et un proxy open source qui exposent une API uniforme sur plus de 100 fournisseurs de LLM — et qui maintiennent le registre de prix de modèles sur lequel s'appuient bien des piles d'attribution de coûts.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
LiteLLM est un SDK Python et un serveur proxy qui traduisent une interface commune — complétions, embeddings, traitement par lots — vers l'API native de chaque fournisseur. Il livre aussi une carte de prix par modèle maintenue en continu, largement réutilisée à elle seule pour la comptabilité des coûts.
Pourquoi c'est important
Le support multi-fournisseurs sans N intégrations sur mesure est la valeur évidente. La plus discrète est le coût : une attribution précise des dépenses exige le prix au moment de l'appel pour chaque modèle, et maintenir cette table à la main est une bataille perdue d'avance.
Concepts liés
Passerelle IA, Passerelle de modèles, Coût des LLM, Routage de modèles.
Ressources connexes
Un point d'intégration unique devant tous les modèles d'IA que vos applications utilisent — pour le routage, la rotation des clés, les limites de débit, la bascule, l'attribution des coûts et l'observabilité.
Le composant d'une plateforme IA qui route chaque appel de modèle — choix du fournisseur, limites de débit et bascule, attribution des coûts, émission de traces — pour que les applications n'appellent jamais les fournisseurs directement.
La dépense totale en API de modèles de langage à l'échelle d'une organisation — jetons d'entrée, jetons de sortie, embeddings, affinage — et la pratique qui consiste à l'attribuer, l'optimiser et la budgéter.
Une stratégie de passerelle pour choisir le bon modèle par tâche — selon la confidentialité, le coût, la latence, la qualité et le mode de défaillance — et basculer proprement quand un fournisseur se dégrade.
Comment nous l'utilisons
Les embeddings et les soumissions par lots de notre pile de production passent par LiteLLM, et son registre de prix alimente le coût en USD par appel consigné dans le journal d'usage. Les exécutions d'agents, elles, passent par Pydantic AI avec la même comptabilité d'usage par-dessus.