Substrat de données

Lakehouse

Une architecture qui combine le stockage objet économique et les garanties de table d'un entrepôt — le substrat où l'analytique, le retrieval IA et l'entraînement ML lisent les mêmes tables gouvernées.

Principe directeur

L'IA de production est un système : contexte, outils, permissions, traces, évaluations et boucles de rétroaction autour du modèle.

Ce que c'est

Un lakehouse, c'est l'économie du data lake avec la rigueur du data warehouse. Des fichiers stockés en Parquet sur du stockage objet économique (S3, GCS, Azure Blob), gérés par un format de table ouvert (Apache Iceberg, Delta Lake, Apache Hudi) qui ajoute les transactions ACID, l'évolution de schéma et le voyage dans le temps. Un seul substrat, interrogé par plusieurs moteurs.

Pourquoi c'est important

Avant les lakehouses, les organisations dupliquaient leurs données : un entrepôt pour l'analytique, un lac séparé pour le ML, une troisième copie pour l'IA. Les copies dérivaient. Les chiffres se contredisaient. Le lakehouse élimine les doublons — l'analytique et l'IA lisent les mêmes tables fiables.

Comment ça fonctionne

Voir l'article dédié Architecture lakehouse pour le mécanisme complet.

Concepts liés

Architecture lakehouse, Fondations de données, Apache Iceberg, Delta Lake.

Ressources connexes