Inférence
Exécuter un modèle entraîné pour obtenir une réponse — la chose que vous payez au jeton, et la couche où vivent la latence, le coût et les choix de déploiement.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
L'entraînement construit un modèle ; l'inférence l'utilise. Chaque réponse de clavardage, extraction, embedding et étape d'agent est un appel d'inférence. Pour presque toutes les organisations, la question pratique n'est pas comment les modèles sont entraînés, mais où et comment l'inférence tourne : l'API d'un fournisseur, une plateforme infonuagique ou votre propre matériel.
Pourquoi c'est important
L'inférence est le coût récurrent de l'IA en production, facturé au jeton. Sa latence façonne l'expérience utilisateur, et son lieu d'exécution détermine quelles données peuvent y transiter — la raison pour laquelle les charges réglementées exigent parfois une inférence privée.
Concepts liés
Routage de modèles, Inférence privée, Cache de prompts, Inférence par lots, Coût des LLM.
Ressources connexes
Une stratégie de passerelle pour choisir le bon modèle par tâche — selon la confidentialité, le coût, la latence, la qualité et le mode de défaillance — et basculer proprement quand un fournisseur se dégrade.
Un patron de workflow IA de production relié aux données, aux agents, aux évaluations et aux opérations.
Réutiliser le préfixe déjà traité d'un prompt d'un appel à l'autre — instructions système, définitions d'outils, longs documents — pour que le contexte répété coûte une fraction du plein prix et revienne plus vite.
Soumettre de grands ensembles de requêtes de modèle via l'API asynchrone de traitement par lots d'un fournisseur — typiquement à environ la moitié du prix des appels interactifs — pour les charges IA qui n'ont pas besoin d'une réponse immédiate.
Comment ça fonctionne
La plupart des charges tournent sur des API de fournisseurs (Anthropic, OpenAI, Google) derrière une passerelle qui route selon le coût, la qualité et la classe de confidentialité. Les modèles à poids ouverts servis par des moteurs comme vLLM ou Ollama couvrent les exigences privées ou hors réseau. Le cache de prompts et les API par lots sont les deux leviers standards pour réduire la dépense d'inférence sans toucher à la qualité.