Chapitre 2. Introduction à l'analyse de données avec PySpark
Python est le langage le plus utilisé pour les tâches liées à la science des données. La perspective de pouvoir faire du calcul statistique et de la programmation web en utilisant le même langage a contribué à sa montée en popularité au début des années 2010. Cela a donné naissance à un écosystème florissant d'outils et à une communauté utile pour l'analyse des données, souvent appelée l'écosystème PyData. C'est l'une des principales raisons de la popularité de PySpark. Le fait de pouvoir tirer parti de l'informatique distribuée via Spark en Python aide les praticiens de la science des données à être plus productifs en raison de la familiarité avec le langage de programmation et de la présence d'une vaste communauté. C'est pour cette même raison que nous avons choisi d'écrire nos exemples en PySpark.
Il est difficile d'exprimer à quel point il est transformateur d'effectuer tous vos regroupements et analyses de données dans un seul environnement, quel que soit l'endroit où les données elles-mêmes sont stockées et traitées. C'est le genre de chose qu'il faut expérimenter pour comprendre, et nous voulions être sûrs que nos exemples capturent un peu de ce sentiment magique que nous avons ressenti lorsque nous avons commencé à utiliser PySpark. Par exemple, PySpark offre une interopérabilité ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access