Préface
La longue lignée de prédécesseurs d'Apache Spark, de MPI (message passing interface) à MapReduce, a permis d'écrire des programmes qui tirent parti de ressources massives tout en faisant abstraction des détails tatillons des systèmes distribués. Autant les besoins en traitement de données ont motivé le développement de ces frameworks, autant, d'une certaine manière, le domaine du big data leur est devenu tellement lié que son champ d'application est défini par ce que ces frameworks peuvent gérer. La promesse initiale de Spark était d'aller un peu plus loin - de faire en sorte que l'écriture de programmes distribués ressemble à l'écriture de programmes ordinaires.
La montée en puissance de la popularité de Spark a coïncidé avec celle de l'écosystème des données Python (PyData). Il est donc logique que l'API Python de Spark - PySpark - ait considérablement gagné en popularité au cours des dernières années. Bien que l'écosystème PyData ait récemment fait jaillir quelques options de programmation distribuée, Apache Spark reste l'un des choix les plus populaires pour travailler avec de grands ensembles de données dans tous les secteurs et domaines. Grâce aux récents efforts d'intégration de PySpark avec les autres outils PyData, l'apprentissage du framework peut t'aider à stimuler considérablement ta productivité en tant que praticien de la science ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access