Embeddings
Des représentations numériques de texte (ou d'images) où les sens semblables atterrissent proches les uns des autres — la mathématique qui permet à un système de chercher par sens plutôt que par mots-clés.
L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.
Ce que c'est
Un modèle d'embedding transforme un morceau de texte en vecteur — une longue liste de nombres — positionné pour que les textes au sens proche se retrouvent voisins. « Remboursez ma commande » et « Je veux ravoir mon argent » ne partagent presque aucun mot, mais atterrissent proches dans l'espace d'embedding. C'est cette propriété qui alimente la recherche sémantique.
Pourquoi c'est important
Les embeddings sont le pont entre la façon dont les gens formulent les choses et la façon dont vos données sont écrites. Ils alimentent le retrieval des assistants, la détection de doublons, le regroupement des thèmes de soutien et la recommandation. Quand des réponses d'IA donnent l'impression d'avoir « compris la question », ce sont les embeddings qui ont compris.
Concepts liés
Recherche vectorielle, Recherche sémantique, Découpage (chunking), pgvector.
Ressources connexes
Pipelines de retrieval qui combinent découpage, embeddings, filtrage par métadonnées, recherche hybride par mots-clés, reranking, permissions et évaluation — pas juste des lookups au plus proche voisin.
Une recherche qui apparie le sens plutôt que les mots exacts — posez la question dans vos propres mots et trouvez le document qui y répond, même s'il emploie un vocabulaire différent.
Fractionner des documents en morceaux à la taille du retrieval — assez petits pour chercher avec précision, assez grands pour garder leur sens — avant de les transformer en embeddings pour la recherche.
L'extension Postgres qui ajoute des types vectoriels et des index de similarité à la base de données que vous exploitez déjà — le défaut pragmatique pour la recherche d'embeddings en deçà des très grandes échelles.
Comment ça fonctionne
Les documents sont découpés, chaque chunk est transformé une fois en embedding et stocké dans un index vectoriel (pgvector dans notre pile) ; au moment de la question, la requête est transformée à son tour et les chunks les plus proches sont récupérés. Les embeddings se périment quand le contenu change, alors le rafraîchissement tourne à une cadence documentée, et la version du modèle d'embedding est suivie — changer de modèle signifie recalculer les embeddings du corpus.