Substrat de données

RAG agentique

Une génération augmentée par retrieval où le système décide quand, quoi et comment récupérer — en routant entre les sources, en vérifiant si les résultats suffisent et en relançant le retrieval quand ce n'est pas le cas — plutôt que d'exécuter une recherche fixe par question.

Principe directeur

L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.

Ce que c'est

Le RAG classique récupère les top-k chunks pour chaque question, qu'elle en ait besoin ou non. Le RAG agentique donne du jugement à la boucle de retrieval : décider si un tour a besoin de retrieval, choisir la source et la requête, évaluer si les résultats répondent vraiment à la question, et repartir pour une passe plus large ou différente quand ce n'est pas le cas.

Pourquoi c'est important

Le retrieval fixe échoue aux deux extrêmes. Il brûle des jetons à récupérer pour des questions qui n'en demandaient pas, et il répond maigrement quand la première recherche a raté. Dépenser l'effort de retrieval là où la question l'exige améliore à la fois le coût et la qualité de l'ancrage.

Comment nous le construisons

Une porte déterministe décide si un tour déclenche le retrieval. Une recherche hybride — similarité vectorielle fusionnée avec le classement plein texte par fusion de rangs réciproques — exécute la recherche. Une vérification de suffisance après la réponse déclenche une seule re-récupération bornée quand l'ancrage est mince. Garder la boucle bornée garde la latence et le coût prévisibles ; une boucle de retrieval non bornée est en soi un mode de défaillance.

Concepts liés

RAG, Retrieval hybride, Reranking, Recherche vectorielle.

Ressources connexes