Chapitre 5. Lac de données
Les big data ont commencé à apparaître dans des volumes sans précédent au début des années 2010 en raison de l'augmentation des sources qui produisent des données semi-structurées et non structurées, telles que les capteurs, les vidéos et les médias sociaux. Les données semi-structurées et non structurées détiennent une quantité phénoménale de valeur - pense aux informations contenues dans des années de courriels de clients ! Cependant, les entrepôts de données relationnels de l'époque ne pouvaient traiter que des données structurées. Ils avaient également du mal à traiter de grandes quantités de données ou des données qui devaient être ingérées souvent, et n'étaient donc pas une option pour le stockage de ces types de données. Cela a obligé l'industrie à trouver une solution : les lacs de données. Les lacs de données peuvent facilement traiter les données semi-structurées et non structurées et gérer les données qui sont souvent ingérées.
Il y a quelques années, j'ai discuté avec des analystes d'une grande chaîne de magasins qui voulaient ingérer des données de Twitter pour savoir ce que les clients pensaient de leurs magasins. Ils savaient que les clients hésiteraient à faire part de leurs plaintes aux employés du magasin, mais qu'ils s'empresseraient de les publier sur Twitter. Je les ai aidés à ingérer les données de Twitter ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access