Chapitre 12. L'entrepôt de données
J'ai brièvement abordé le data lakehouse en tant qu'harmonisation des concepts de lac de données et d'entrepôt de données. L'idée derrière un data lakehouse est de simplifier les choses en utilisant juste un data lake pour stocker toutes tes données, au lieu d'avoir également un entrepôt de données relationnel séparé. Pour ce faire, le lac de données a besoin de plus de fonctionnalités pour remplacer les caractéristiques d'un RDW. C'est là que le Delta Lake de Databricks entre en jeu.
Delta Lake est une couche logicielle de stockage transactionnel qui s'exécute au-dessus d'un lac de données existant et ajoute des fonctionnalités de type RDW qui améliorent la fiabilité, la sécurité et les performances du lac. Delta Lake lui-même n'est pas un système de stockage. Dans la plupart des cas, il est facile de transformer un lac de données en Delta Lake ; il te suffit de spécifier, lorsque tu stockes des données dans ton lac de données, que tu veux les enregistrer au format Delta Lake (par opposition à d'autres formats, comme CSV ou JSON).
En coulisses, lorsque tu stockes un fichier au format Delta Lake, il est stocké de manière spécialisée, qui consiste en des fichiers Parquet dans des dossiers et un journal des transactions pour garder une trace de toutes les modifications apportées aux données. Alors que les données réelles ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access