Substrat de données

Découpage (chunking)

Fractionner des documents en morceaux à la taille du retrieval — assez petits pour chercher avec précision, assez grands pour garder leur sens — avant de les transformer en embeddings pour la recherche.

Principe directeur

L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.

Ce que c'est

Les systèmes de retrieval ne cherchent pas des documents entiers ; ils cherchent des chunks. Le découpage est la décision d'où couper : par titre, par paragraphe, par nombre de jetons avec chevauchement, par ligne de tableau. Chaque chunk est transformé en embedding et indexé avec des métadonnées sur sa provenance.

Pourquoi c'est important

Un mauvais découpage est l'une des causes les plus fréquentes de mauvaises réponses d'IA. Coupez trop petit et le texte récupéré manque de contexte ; trop grand et la phrase pertinente se noie dans le bruit tout en brûlant le budget de contexte. Des frontières de chunk qui scindent un tableau ou séparent une légende de sa figure produisent des citations erronées mais assurées.

Comment ça fonctionne

La stratégie suit le type de contenu : les documents longs se découpent sur la structure avec un chevauchement borné en jetons ; les transcriptions, sur les tours de parole ; les tableaux restent entiers ou se découpent par groupes de lignes ; le code, par fonctions. Taille de chunk, chevauchement et métadonnées sont des paramètres du jeu d'évaluations — mesurés contre de vraies requêtes, pas devinés.

Concepts liés

Embeddings, Recherche vectorielle, RAG, Préparation au retrieval.

Ressources connexes