Qu’est-ce qu’un lakehouse de données ? Définition, avantages et fonctionnalités

Big data concept background.

Image: Andrii Fanta/Adobe Stock

Nov 1, 2023
10 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Un lakehouse de données est une architecture hybride de gestion des données qui réunit les meilleures fonctionnalités d’un lac de données et d’un entrepôt de données au sein d’une seule solution de gestion des données.

Un lac de données est un référentiel centralisé qui permet de stocker de grandes quantités de données dans leur format natif et brut. À l’inverse, un entrepôt de données est un référentiel qui stocke des données structurées et semi-structurées provenant de plusieurs sources à des fins d’analyse et de génération de rapports.

Un lakehouse de données vise à combler l’écart entre ces deux approches de la gestion des données en combinant la flexibilité, l’évolutivité et le faible coût des lacs de données avec les performances et les transactions ACID (atomicité, cohérence, isolation, durabilité) des entrepôts de données. Cela permet d’effectuer des opérations de veille stratégique et d’analyse sur toutes les données depuis une plateforme unique.

Aller à :



Que fait un lakehouse de données ? 

Un lakehouse de données exploite l’évolutivité, la flexibilité et la rentabilité d’un référentiel de données, permettant aux organisations d’ingérer de grandes quantités de données sans imposer d’exigences strictes en matière de schéma ou de format.

Advertisement

Contrairement aux lakehouses de données, les lacs de données seuls ne disposent pas des fonctionnalités de gouvernance, d’organisation et de performance nécessaires à l’analyse et à la génération de rapports.

Les lakehouses de données se distinguent également des entrepôts de données. Les entrepôts de données utilisent des processus d’extraction, de chargement et de transformation (ELT), ou, à défaut, des processus d’extraction, de transformation et de chargement (ETL), pour charger des données structurées dans une infrastructure de base de données relationnelle ; un entrepôt de données prend en charge les applications d’analyse des données d’entreprise et de veille stratégique. Toutefois, un entrepôt de données est limité par son inefficacité à traiter les données non structurées et semi-structurées. En outre, son coût peut augmenter à mesure que les sources et le volume des données croissent au fil du temps.

Les lakehouses de données remédient aux limites et aux difficultés des entrepôts de données comme des lacs de données en associant la flexibilité et la rentabilité des lacs de données aux fonctionnalités de gouvernance, d’organisation et de performance des entrepôts de données.

Les utilisateurs suivants peuvent exploiter un lakehouse de données :

  • Les data scientists peuvent utiliser un lakehouse de données pour l’apprentissage automatique, la BI, l’analyse SQL et la data science.
  • Les analystes métier peuvent l’exploiter pour explorer et analyser diverses sources de données et applications métier.
  • Les chefs de produit, les professionnels du marketing, ainsi que les dirigeants peuvent utiliser les lakehouses de données pour surveiller les indicateurs clés de performance et les tendances.

Voir aussi : Qu’est-ce que l’analyse des données ?

The data lakehouse combines the functionality of a data warehouse with that of a data lake. Source: Databricks.

Le lakehouse de données combine les fonctionnalités d’un entrepôt de données avec celles d’un lac de données. Source : Databricks.

Advertisement

Pour approfondir : lakehouse de données, entrepôt de données et lac de données

Nous avons établi qu’un lakehouse de données est le fruit des fonctionnalités d’un entrepôt de données et d’un lac de données. Il permet une ingestion des données efficace et très flexible. Examinons plus en détail leurs différences.

Entrepôt de données

L’entrepôt de données constitue le « house » d’un lakehouse de données. Il s’agit d’un type de système de gestion des données spécialement conçu pour l’analyse des données ; il facilite et prend en charge les activités de veille stratégique (BI). Un entrepôt de données comprend généralement plusieurs éléments, notamment :

  • Une base de données relationnelle.
  • Une solution ELT pour préparer les données à l’analyse, à l’analyse statistique, à la génération de rapports et à l’exploration de données.
  • Des outils d’analyse côté client pour la visualisation des données.

Lac de données

Le lac de données constitue le « lake » d’un lakehouse de données. Il s’agit d’un référentiel de stockage flexible et centralisé qui permet de stocker des données structurées, semi-structurées et non structurées, quelle que soit leur échelle. Un lac de données utilise une méthodologie de schéma à la lecture, ce qui signifie qu’aucun schéma prédéfini ne doit être appliqué aux données avant leur stockage.

Ce tableau compare les concepts de lakehouse de données, d’entrepôt de données et de lac de données.

ParamètresLakehouse de donnéesEntrepôt de donnéesLac de données
Structure des donnéesStructurées, semi-structurées et brutesDonnées structurées (tabulaires, relationnelles)Non structurées, semi-structurées et brutes
Stockage des donnéesAssocie données structurées et brutes, avec schéma à la lectureStocke les données dans un format hautement structuré avec un schéma prédéfiniStocke les données sous leur forme brute (par exemple, JSON, CSV), sans schéma imposé
SchémaAssocie des éléments du schéma à la lecture et du schéma à l’écritureUtilise un schéma fixe, appelé schéma en étoile, en constellation ou en floconSchéma à la lecture : les données peuvent être stockées sans schéma prédéfini
Performances des requêtesAssocie les atouts de l’entrepôt de données et du lac de données pour offrir des performances de requête équilibréesOptimisé pour des performances de requête et d’analyse rapides grâce à des techniques d’indexation et d’optimisationPerformances de requête plus lentes
Transformation des donnéesInclut souvent des fonctionnalités d’évolution du schéma et d’ETLETL et ELTFonctionnalités ETL intégrées limitées ; les données doivent souvent être transformées avant l’analyse
Gouvernance des donnéesVarie selon les implémentations, mais est généralement meilleure que celle d’un lac de donnéesGouvernance solide des données, avec contrôle de l’accès aux données et de la conformitéFonctionnalités de gouvernance des données limitées ; les données peuvent ne pas disposer de fonctions de gouvernance
Cas d’utilisationCharges de travail analytiques combinant données structurées et brutesVeille stratégique, génération de rapports, analyses structuréesExploration des données, ingestion des données, data science
Outils et écosystèmeExploite des plateformes de données et des frameworks de traitement des données dans le cloudUtilise généralement des systèmes de bases de données relationnelles traditionnels et des outils ETLUtilise des technologies du big data comme Hadoop, Spark et les bases de données NoSQL
CoûtRentableCoûteuxMoins cher qu’un entrepôt de données
AdoptionGagne en popularité pour les charges de travail analytiques modernes qui nécessitent des données structurées et semi-structuréesCourant dans les entreprises pour l’analyse de données structuréesCourant dans les contextes de big data et de data science
Advertisement

Les 5 couches de l’architecture d’un lakehouse de données

L’architecture informatique du lakehouse de données se compose de cinq couches :

Couche d’ingestion

L’ingestion des données est la première couche de l’architecture d’un lakehouse de données. Elle collecte les données provenant de diverses sources et les transmet à la couche de stockage ou au système de traitement des données. La couche d’ingestion peut utiliser différents protocoles pour se connecter aux sources internes et externes, notamment :

  • Systèmes de gestion de bases de données
  • Applications de logiciel en tant que service (SaaS)
  • Bases de données NoSQL
  • Réseaux sociaux
  • Applications CRM
  • Capteurs IoT
  • Systèmes de fichiers

La couche d’ingestion peut effectuer l’extraction des données en un seul lot volumineux ou par petites portions, selon la source et la taille des données.

​​Couche de stockage

La couche de stockage du lakehouse de données accepte tous les types de données sous forme d’objets dans des stockages d’objets abordables tels qu’AWS S3.

Cette couche stocke les données structurées, non structurées et semi-structurées dans des formats de fichiers open source tels que Parquet ou Optimized Row Columnar (ORC). Un lakehouse de données peut être déployé sur site à l’aide d’un système de fichiers distribué comme Hadoop Distributed File System (HDFS), ou dans le cloud avec des services de stockage comme Amazon S3.

Voir aussi : Principaux logiciels et outils d’analyse des données 

Couche de métadonnées

Cette couche est très importante, car elle constitue l’origine du lakehouse de données. Les métadonnées sont des données qui fournissent des informations sur d’autres éléments de données ; dans cette couche, elles forment un catalogue unifié qui comprend les métadonnées des objets du lac de données. La couche de métadonnées offre également aux utilisateurs diverses fonctionnalités de gestion, notamment :

  • Les transactions ACID (atomicité, cohérence, isolation, durabilité) garantissent l’atomicité, la cohérence, l’isolation et la durabilité des modifications apportées aux données.
  • Mise en cache des fichiers Les fonctionnalités de mise en cache des fichiers optimisent l’accès aux données en conservant en mémoire les fichiers fréquemment consultés afin qu’ils soient immédiatement disponibles.
  • Indexation accélère les requêtes en permettant de récupérer rapidement les données.
  • Gestion des versions des données permet aux utilisateurs d’enregistrer des versions spécifiques des données.
Advertisement

La couche de métadonnées permet aux utilisateurs d’implémenter des schémas prédéfinis afin d’améliorer la gouvernance des données et d’activer des fonctionnalités de contrôle des accès et d’audit.

Couche API

La couche API est un composant particulièrement important d’un lakehouse de données. Elle permet aux ingénieurs data, aux data scientists et aux analystes d’accéder aux données stockées dans le lakehouse de données et de les manipuler à des fins d’analyse, de création de rapports et pour d’autres cas d’usage.

Couche de consommation

La couche de consommation est la dernière couche de l’architecture d’un lakehouse de données : elle héberge des outils et des applications tels que Power BI et Tableau, permettant aux utilisateurs d’interroger, d’analyser et de traiter les données. Elle permet aux utilisateurs d’accéder aux données stockées dans le lakehouse de données et de les exploiter pour divers cas d’usage métier.

Fonctionnalités clés d’un lakehouse de données

  • Prise en charge des transactions ACID : De nombreux lakehouses de données utilisent une technologie comme Delta Lake (développée par Databricks) ou implémentent des transactions ACID afin de garantir la cohérence et la fiabilité des données dans un environnement distribué.
  • Stockage de données unifié et peu coûteux : Un lakehouse de données constitue une solution économique pour stocker tous les types de données, notamment les données structurées, semi-structurées et non structurées.
  • Prise en charge des données non structurées et des flux de données : Alors qu’un entrepôt de données est limité aux données structurées, un lakehouse de données prend en charge de nombreux formats de données, notamment les vidéos, les fichiers audio, les documents texte, les fichiers PDF, les journaux système et bien plus encore. Un lakehouse de données prend également en charge l’ingestion des données en temps réel, ainsi que leur diffusion en continu depuis des appareils.
  • Prise en charge des formats ouverts : Les lakehouses de données peuvent stocker les données dans des formats de fichiers standardisés tels qu’Apache Avro, Parquet et ORC (Optimized Row Columnar).
Advertisement

Avantages d’un lakehouse de données

Un lakehouse de données offre de nombreux avantages, ce qui en fait une alternative intéressante à un entrepôt de données ou à un lac de données autonome. Les lakehouses de données combinent la qualité de service et les performances d’un entrepôt de données avec le coût abordable et l’infrastructure de stockage flexible d’un lac de données. Un lakehouse de données aide les utilisateurs à résoudre les problèmes suivants.

  • Plateforme de données unifiée : Elle sert de référentiel de données structurées et non structurées, éliminant ainsi les silos de données.
  • Traitement en temps réel et par lots : Les lakehouses de données prennent en charge le traitement en temps réel pour obtenir rapidement des informations immédiates, ainsi que le traitement par lots pour les analyses et la création de rapports à grande échelle.
  • Réduction des coûts : La maintenance d’un entrepôt de données et d’un lac de données distincts peut être trop coûteuse. Avec un lakehouse de données, les équipes chargées de la gestion des données n’ont qu’une seule plateforme de données à déployer et à gérer.
  • Amélioration de la gouvernance des données : Les lakehouses de données regroupent les ressources et les sources de données, ce qui permet de mieux contrôler la sécurité, les indicateurs, les accès fondés sur les rôles et d’autres éléments essentiels de la gestion.
  • Réduction de la duplication des données : Lorsque des copies des mêmes données existent dans des systèmes disparates, elles sont plus susceptibles d’être incohérentes et moins fiables. Les lakehouses de données fournissent aux organisations une source de données unique, partageable dans toute l’entreprise, évitant ainsi les incohérences et les coûts de stockage supplémentaires liés à la duplication des données.

Défis liés aux lakehouses de données

Un lakehouse de données n’est pas une solution miracle pour relever tous vos défis liés aux données. Le concept de lakehouse de données est relativement récent et son plein potentiel ainsi que ses capacités sont encore à l’étude et continuent d’être appréhendés.

Un lakehouse de données est un système complexe à construire de zéro. Vous devrez soit opter pour une solution de lakehouse de données prête à l’emploi, dont les performances varient fortement selon le type de requête et le moteur qui la traite, soit investir du temps et des ressources dans le développement et la maintenance de votre propre solution.

En résumé : le lakehouse de données

Le lakehouse de données est un concept récent qui représente une approche moderne de la gestion des données. Il ne remplace pas purement et simplement l’entrepôt de données ou le lac de données traditionnel, mais combine les deux.

Bien que les lakehouses de données offrent de nombreux avantages qui en font une option attrayante, ils ne sont pas infaillibles. Vous devez prendre des mesures proactives pour éviter et gérer les risques de sécurité, la complexité ainsi que les problèmes de qualité et de gouvernance des données susceptibles de survenir lors de l’utilisation d’un système de lakehouse de données. 

Voir aussi : Bonnes pratiques en matière d’IA générative et d’analyse des données 

Aminu Abdullahi

Aminu Abdullahi is a B2C and B2B technology and finance writer with more than six years of experience covering enterprise IT, cybersecurity, cloud computing, artificial intelligence, fintech, business software, and emerging technologies. His work has appeared in publications including TechRepublic, eWEEK, Channel Insider, Geekflare, Enterprise Networking Planet, eSecurity Planet, CIO Insight, and Webopedia. With a technical background in computer science, he specializes in translating complex technology topics into clear, accessible content for business leaders and decision-makers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.