Un lakehouse de données est une architecture hybride de gestion des données qui réunit les meilleures fonctionnalités d’un lac de données et d’un entrepôt de données au sein d’une seule solution de gestion des données.
Un lac de données est un référentiel centralisé qui permet de stocker de grandes quantités de données dans leur format natif et brut. À l’inverse, un entrepôt de données est un référentiel qui stocke des données structurées et semi-structurées provenant de plusieurs sources à des fins d’analyse et de génération de rapports.
Un lakehouse de données vise à combler l’écart entre ces deux approches de la gestion des données en combinant la flexibilité, l’évolutivité et le faible coût des lacs de données avec les performances et les transactions ACID (atomicité, cohérence, isolation, durabilité) des entrepôts de données. Cela permet d’effectuer des opérations de veille stratégique et d’analyse sur toutes les données depuis une plateforme unique.
Aller à :
- Que fait un lakehouse de données ?
- Différences entre un lakehouse de données, un entrepôt de données et un lac de données
- Les 5 couches de l’architecture d’un lakehouse de données
- Principales fonctionnalités d’un lakehouse de données
- Avantages d’un lakehouse de données
- Défis liés aux lakehouses de données
- En résumé : le lakehouse de données
- Que fait un lakehouse de données ?
- Pour approfondir : lakehouse de données, entrepôt de données et lac de données
- Les 5 couches de l’architecture d’un lakehouse de données
- Fonctionnalités clés d’un lakehouse de données
- Avantages d’un lakehouse de données
- Défis liés aux lakehouses de données
- En résumé : le lakehouse de données
Que fait un lakehouse de données ?
Un lakehouse de données exploite l’évolutivité, la flexibilité et la rentabilité d’un référentiel de données, permettant aux organisations d’ingérer de grandes quantités de données sans imposer d’exigences strictes en matière de schéma ou de format.
Contrairement aux lakehouses de données, les lacs de données seuls ne disposent pas des fonctionnalités de gouvernance, d’organisation et de performance nécessaires à l’analyse et à la génération de rapports.
Les lakehouses de données se distinguent également des entrepôts de données. Les entrepôts de données utilisent des processus d’extraction, de chargement et de transformation (ELT), ou, à défaut, des processus d’extraction, de transformation et de chargement (ETL), pour charger des données structurées dans une infrastructure de base de données relationnelle ; un entrepôt de données prend en charge les applications d’analyse des données d’entreprise et de veille stratégique. Toutefois, un entrepôt de données est limité par son inefficacité à traiter les données non structurées et semi-structurées. En outre, son coût peut augmenter à mesure que les sources et le volume des données croissent au fil du temps.
Les lakehouses de données remédient aux limites et aux difficultés des entrepôts de données comme des lacs de données en associant la flexibilité et la rentabilité des lacs de données aux fonctionnalités de gouvernance, d’organisation et de performance des entrepôts de données.
Les utilisateurs suivants peuvent exploiter un lakehouse de données :
- Les data scientists peuvent utiliser un lakehouse de données pour l’apprentissage automatique, la BI, l’analyse SQL et la data science.
- Les analystes métier peuvent l’exploiter pour explorer et analyser diverses sources de données et applications métier.
- Les chefs de produit, les professionnels du marketing, ainsi que les dirigeants peuvent utiliser les lakehouses de données pour surveiller les indicateurs clés de performance et les tendances.
Voir aussi : Qu’est-ce que l’analyse des données ?

Le lakehouse de données combine les fonctionnalités d’un entrepôt de données avec celles d’un lac de données. Source : Databricks.
Pour approfondir : lakehouse de données, entrepôt de données et lac de données
Nous avons établi qu’un lakehouse de données est le fruit des fonctionnalités d’un entrepôt de données et d’un lac de données. Il permet une ingestion des données efficace et très flexible. Examinons plus en détail leurs différences.
Entrepôt de données
L’entrepôt de données constitue le « house » d’un lakehouse de données. Il s’agit d’un type de système de gestion des données spécialement conçu pour l’analyse des données ; il facilite et prend en charge les activités de veille stratégique (BI). Un entrepôt de données comprend généralement plusieurs éléments, notamment :
- Une base de données relationnelle.
- Une solution ELT pour préparer les données à l’analyse, à l’analyse statistique, à la génération de rapports et à l’exploration de données.
- Des outils d’analyse côté client pour la visualisation des données.
Lac de données
Le lac de données constitue le « lake » d’un lakehouse de données. Il s’agit d’un référentiel de stockage flexible et centralisé qui permet de stocker des données structurées, semi-structurées et non structurées, quelle que soit leur échelle. Un lac de données utilise une méthodologie de schéma à la lecture, ce qui signifie qu’aucun schéma prédéfini ne doit être appliqué aux données avant leur stockage.
Ce tableau compare les concepts de lakehouse de données, d’entrepôt de données et de lac de données.
| Paramètres | Lakehouse de données | Entrepôt de données | Lac de données |
|---|---|---|---|
| Structure des données | Structurées, semi-structurées et brutes | Données structurées (tabulaires, relationnelles) | Non structurées, semi-structurées et brutes |
| Stockage des données | Associe données structurées et brutes, avec schéma à la lecture | Stocke les données dans un format hautement structuré avec un schéma prédéfini | Stocke les données sous leur forme brute (par exemple, JSON, CSV), sans schéma imposé |
| Schéma | Associe des éléments du schéma à la lecture et du schéma à l’écriture | Utilise un schéma fixe, appelé schéma en étoile, en constellation ou en flocon | Schéma à la lecture : les données peuvent être stockées sans schéma prédéfini |
| Performances des requêtes | Associe les atouts de l’entrepôt de données et du lac de données pour offrir des performances de requête équilibrées | Optimisé pour des performances de requête et d’analyse rapides grâce à des techniques d’indexation et d’optimisation | Performances de requête plus lentes |
| Transformation des données | Inclut souvent des fonctionnalités d’évolution du schéma et d’ETL | ETL et ELT | Fonctionnalités ETL intégrées limitées ; les données doivent souvent être transformées avant l’analyse |
| Gouvernance des données | Varie selon les implémentations, mais est généralement meilleure que celle d’un lac de données | Gouvernance solide des données, avec contrôle de l’accès aux données et de la conformité | Fonctionnalités de gouvernance des données limitées ; les données peuvent ne pas disposer de fonctions de gouvernance |
| Cas d’utilisation | Charges de travail analytiques combinant données structurées et brutes | Veille stratégique, génération de rapports, analyses structurées | Exploration des données, ingestion des données, data science |
| Outils et écosystème | Exploite des plateformes de données et des frameworks de traitement des données dans le cloud | Utilise généralement des systèmes de bases de données relationnelles traditionnels et des outils ETL | Utilise des technologies du big data comme Hadoop, Spark et les bases de données NoSQL |
| Coût | Rentable | Coûteux | Moins cher qu’un entrepôt de données |
| Adoption | Gagne en popularité pour les charges de travail analytiques modernes qui nécessitent des données structurées et semi-structurées | Courant dans les entreprises pour l’analyse de données structurées | Courant dans les contextes de big data et de data science |
Les 5 couches de l’architecture d’un lakehouse de données
L’architecture informatique du lakehouse de données se compose de cinq couches :
Couche d’ingestion
L’ingestion des données est la première couche de l’architecture d’un lakehouse de données. Elle collecte les données provenant de diverses sources et les transmet à la couche de stockage ou au système de traitement des données. La couche d’ingestion peut utiliser différents protocoles pour se connecter aux sources internes et externes, notamment :
- Systèmes de gestion de bases de données
- Applications de logiciel en tant que service (SaaS)
- Bases de données NoSQL
- Réseaux sociaux
- Applications CRM
- Capteurs IoT
- Systèmes de fichiers
La couche d’ingestion peut effectuer l’extraction des données en un seul lot volumineux ou par petites portions, selon la source et la taille des données.
Couche de stockage
La couche de stockage du lakehouse de données accepte tous les types de données sous forme d’objets dans des stockages d’objets abordables tels qu’AWS S3.
Cette couche stocke les données structurées, non structurées et semi-structurées dans des formats de fichiers open source tels que Parquet ou Optimized Row Columnar (ORC). Un lakehouse de données peut être déployé sur site à l’aide d’un système de fichiers distribué comme Hadoop Distributed File System (HDFS), ou dans le cloud avec des services de stockage comme Amazon S3.
Voir aussi : Principaux logiciels et outils d’analyse des données
Couche de métadonnées
Cette couche est très importante, car elle constitue l’origine du lakehouse de données. Les métadonnées sont des données qui fournissent des informations sur d’autres éléments de données ; dans cette couche, elles forment un catalogue unifié qui comprend les métadonnées des objets du lac de données. La couche de métadonnées offre également aux utilisateurs diverses fonctionnalités de gestion, notamment :
- Les transactions ACID (atomicité, cohérence, isolation, durabilité) garantissent l’atomicité, la cohérence, l’isolation et la durabilité des modifications apportées aux données.
- Mise en cache des fichiers Les fonctionnalités de mise en cache des fichiers optimisent l’accès aux données en conservant en mémoire les fichiers fréquemment consultés afin qu’ils soient immédiatement disponibles.
- Indexation accélère les requêtes en permettant de récupérer rapidement les données.
- Gestion des versions des données permet aux utilisateurs d’enregistrer des versions spécifiques des données.
La couche de métadonnées permet aux utilisateurs d’implémenter des schémas prédéfinis afin d’améliorer la gouvernance des données et d’activer des fonctionnalités de contrôle des accès et d’audit.
Couche API
La couche API est un composant particulièrement important d’un lakehouse de données. Elle permet aux ingénieurs data, aux data scientists et aux analystes d’accéder aux données stockées dans le lakehouse de données et de les manipuler à des fins d’analyse, de création de rapports et pour d’autres cas d’usage.
Couche de consommation
La couche de consommation est la dernière couche de l’architecture d’un lakehouse de données : elle héberge des outils et des applications tels que Power BI et Tableau, permettant aux utilisateurs d’interroger, d’analyser et de traiter les données. Elle permet aux utilisateurs d’accéder aux données stockées dans le lakehouse de données et de les exploiter pour divers cas d’usage métier.
Fonctionnalités clés d’un lakehouse de données
- Prise en charge des transactions ACID : De nombreux lakehouses de données utilisent une technologie comme Delta Lake (développée par Databricks) ou implémentent des transactions ACID afin de garantir la cohérence et la fiabilité des données dans un environnement distribué.
- Stockage de données unifié et peu coûteux : Un lakehouse de données constitue une solution économique pour stocker tous les types de données, notamment les données structurées, semi-structurées et non structurées.
- Prise en charge des données non structurées et des flux de données : Alors qu’un entrepôt de données est limité aux données structurées, un lakehouse de données prend en charge de nombreux formats de données, notamment les vidéos, les fichiers audio, les documents texte, les fichiers PDF, les journaux système et bien plus encore. Un lakehouse de données prend également en charge l’ingestion des données en temps réel, ainsi que leur diffusion en continu depuis des appareils.
- Prise en charge des formats ouverts : Les lakehouses de données peuvent stocker les données dans des formats de fichiers standardisés tels qu’Apache Avro, Parquet et ORC (Optimized Row Columnar).
Avantages d’un lakehouse de données
Un lakehouse de données offre de nombreux avantages, ce qui en fait une alternative intéressante à un entrepôt de données ou à un lac de données autonome. Les lakehouses de données combinent la qualité de service et les performances d’un entrepôt de données avec le coût abordable et l’infrastructure de stockage flexible d’un lac de données. Un lakehouse de données aide les utilisateurs à résoudre les problèmes suivants.
- Plateforme de données unifiée : Elle sert de référentiel de données structurées et non structurées, éliminant ainsi les silos de données.
- Traitement en temps réel et par lots : Les lakehouses de données prennent en charge le traitement en temps réel pour obtenir rapidement des informations immédiates, ainsi que le traitement par lots pour les analyses et la création de rapports à grande échelle.
- Réduction des coûts : La maintenance d’un entrepôt de données et d’un lac de données distincts peut être trop coûteuse. Avec un lakehouse de données, les équipes chargées de la gestion des données n’ont qu’une seule plateforme de données à déployer et à gérer.
- Amélioration de la gouvernance des données : Les lakehouses de données regroupent les ressources et les sources de données, ce qui permet de mieux contrôler la sécurité, les indicateurs, les accès fondés sur les rôles et d’autres éléments essentiels de la gestion.
- Réduction de la duplication des données : Lorsque des copies des mêmes données existent dans des systèmes disparates, elles sont plus susceptibles d’être incohérentes et moins fiables. Les lakehouses de données fournissent aux organisations une source de données unique, partageable dans toute l’entreprise, évitant ainsi les incohérences et les coûts de stockage supplémentaires liés à la duplication des données.
Défis liés aux lakehouses de données
Un lakehouse de données n’est pas une solution miracle pour relever tous vos défis liés aux données. Le concept de lakehouse de données est relativement récent et son plein potentiel ainsi que ses capacités sont encore à l’étude et continuent d’être appréhendés.
Un lakehouse de données est un système complexe à construire de zéro. Vous devrez soit opter pour une solution de lakehouse de données prête à l’emploi, dont les performances varient fortement selon le type de requête et le moteur qui la traite, soit investir du temps et des ressources dans le développement et la maintenance de votre propre solution.
En résumé : le lakehouse de données
Le lakehouse de données est un concept récent qui représente une approche moderne de la gestion des données. Il ne remplace pas purement et simplement l’entrepôt de données ou le lac de données traditionnel, mais combine les deux.
Bien que les lakehouses de données offrent de nombreux avantages qui en font une option attrayante, ils ne sont pas infaillibles. Vous devez prendre des mesures proactives pour éviter et gérer les risques de sécurité, la complexité ainsi que les problèmes de qualité et de gouvernance des données susceptibles de survenir lors de l’utilisation d’un système de lakehouse de données.
Voir aussi : Bonnes pratiques en matière d’IA générative et d’analyse des données

