Chapitre 1. Analyser les Big Data
Lorsque les gens disent que nous vivons à l'ère du big data, ils entendent par là que nous disposons d'outils pour collecter, stocker et traiter des informations à une échelle jusqu'alors inconnue. Les tâches suivantes n'auraient tout simplement pas pu être accomplies il y a 10 ou 15 ans :
-
Construis un modèle pour détecter les fraudes à la carte de crédit en utilisant des milliers de caractéristiques et des milliards de transactions.
-
Recommande intelligemment des millions de produits à des millions d'utilisateurs.
-
Estimer le risque financier grâce à des simulations de portefeuilles comprenant des millions d'instruments.
-
Manipule facilement les données génomiques de milliers de personnes pour détecter les associations génétiques avec les maladies.
-
Évaluer l'utilisation des terres agricoles et le rendement des cultures pour améliorer l'élaboration des politiques en traitant périodiquement des millions d'images satellites.
Derrière ces capacités se cache un écosystème de logiciels libres qui peuvent exploiter des grappes de serveurs pour traiter des quantités massives de données. L'introduction/la publication d'Apache Hadoop en 2006 a conduit à une adoption généralisée de l'informatique distribuée. L'écosystème des big data et les outils ont évolué à un rythme rapide depuis lors. Les cinq dernières années ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access