RAG
Le patron où un agent IA récupère du contexte pertinent dans vos données avant de générer une réponse — au lieu de s'appuyer uniquement sur ce que le modèle a appris à l'entraînement.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
La génération augmentée par retrieval, ou RAG, est le patron le plus courant pour ancrer les réponses de l'IA dans vos propres données. Étape un : prendre la question de l'utilisateur et chercher les chunks pertinents dans votre contenu indexé. Étape deux : envoyer ces chunks avec la question au modèle et lui demander de répondre en s'en servant. Le modèle utilise vos données ; vous contrôlez ce qu'il voit ; la réponse peut être citée.
Pourquoi c'est important
Sans RAG, un assistant IA répond à partir des connaissances générales intégrées au modèle — incomplètes, possiblement périmées, et certainement pas au fait de votre entreprise. Le RAG est ce qui transforme « une IA qui ne sait rien de nous » en « une IA qui cite nos documents ». Bien fait, c'est la base de toute application IA interne. Mal fait, c'est la source de la plupart des hallucinations.
Concepts liés
Recherche vectorielle, Retrieval hybride, Reranking, Catalogue de données, Qualité des citations.
Ressources connexes
Pipelines de retrieval qui combinent découpage, embeddings, filtrage par métadonnées, recherche hybride par mots-clés, reranking, permissions et évaluation — pas juste des lookups au plus proche voisin.
Un patron de workflow IA de production relié aux données, aux agents, aux évaluations et aux opérations.
Un patron de workflow IA de production relié aux données, aux agents, aux évaluations et aux opérations.
La carte propriétaire des systèmes opérationnels d'une organisation — schémas, documents, code, tickets, événements, propriétaires et permissions — reliés par les relations dont un agent a besoin pour retrouver, citer et agir.
Un patron de workflow IA de production relié aux données, aux agents, aux évaluations et aux opérations.
Comment ça fonctionne
Indexez votre contenu (découpage, embeddings, métadonnées). À la requête : récupérer des candidats (hybride BM25 + dense), appliquer le reranking, filtrer selon les permissions, envoyer les top-k au modèle avec l'instruction de citer. La plupart des bogues de RAG en production surviennent à l'étape du retrieval, pas à celle de la génération — c'est pourquoi la recherche vectorielle est traitée comme un système, pas comme un appel de base de données.