Opérations

Inférence

Exécuter un modèle entraîné pour obtenir une réponse — la chose que vous payez au jeton, et la couche où vivent la latence, le coût et les choix de déploiement.

Principe directeur

L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.

Ce que c'est

L'entraînement construit un modèle ; l'inférence l'utilise. Chaque réponse de clavardage, extraction, embedding et étape d'agent est un appel d'inférence. Pour presque toutes les organisations, la question pratique n'est pas comment les modèles sont entraînés, mais où et comment l'inférence tourne : l'API d'un fournisseur, une plateforme infonuagique ou votre propre matériel.

Pourquoi c'est important

L'inférence est le coût récurrent de l'IA en production, facturé au jeton. Sa latence façonne l'expérience utilisateur, et son lieu d'exécution détermine quelles données peuvent y transiter — la raison pour laquelle les charges réglementées exigent parfois une inférence privée.

Comment ça fonctionne

La plupart des charges tournent sur des API de fournisseurs (Anthropic, OpenAI, Google) derrière une passerelle qui route selon le coût, la qualité et la classe de confidentialité. Les modèles à poids ouverts servis par des moteurs comme vLLM ou Ollama couvrent les exigences privées ou hors réseau. Le cache de prompts et les API par lots sont les deux leviers standards pour réduire la dépense d'inférence sans toucher à la qualité.

Concepts liés

Routage de modèles, Inférence privée, Cache de prompts, Inférence par lots, Coût des LLM.

Ressources connexes