RAG agentique
Une génération augmentée par retrieval où le système décide quand, quoi et comment récupérer — en routant entre les sources, en vérifiant si les résultats suffisent et en relançant le retrieval quand ce n'est pas le cas — plutôt que d'exécuter une recherche fixe par question.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
Le RAG classique récupère les top-k chunks pour chaque question, qu'elle en ait besoin ou non. Le RAG agentique donne du jugement à la boucle de retrieval : décider si un tour a besoin de retrieval, choisir la source et la requête, évaluer si les résultats répondent vraiment à la question, et repartir pour une passe plus large ou différente quand ce n'est pas le cas.
Pourquoi c'est important
Le retrieval fixe échoue aux deux extrêmes. Il brûle des jetons à récupérer pour des questions qui n'en demandaient pas, et il répond maigrement quand la première recherche a raté. Dépenser l'effort de retrieval là où la question l'exige améliore à la fois le coût et la qualité de l'ancrage.
Concepts liés
RAG, Retrieval hybride, Reranking, Recherche vectorielle.
Ressources connexes
Le patron où un agent IA récupère du contexte pertinent dans vos données avant de générer une réponse — au lieu de s'appuyer uniquement sur ce que le modèle a appris à l'entraînement.
Un patron de workflow IA de production relié aux données, aux agents, aux évaluations et aux opérations.
Un patron de workflow IA de production relié aux données, aux agents, aux évaluations et aux opérations.
Pipelines de retrieval qui combinent découpage, embeddings, filtrage par métadonnées, recherche hybride par mots-clés, reranking, permissions et évaluation — pas juste des lookups au plus proche voisin.
Comment nous le construisons
Une porte déterministe décide si un tour déclenche le retrieval. Une recherche hybride — similarité vectorielle fusionnée avec le classement plein texte par fusion de rangs réciproques — exécute la recherche. Une vérification de suffisance après la réponse déclenche une seule re-récupération bornée quand l'ancrage est mince. Garder la boucle bornée garde la latence et le coût prévisibles ; une boucle de retrieval non bornée est en soi un mode de défaillance.