Overview
La quantité de données générées aujourd'hui est stupéfiante et ne cesse de croître. Apache Spark s'est imposé comme l'outil de facto pour analyser les big data et constitue désormais un élément essentiel de la boîte à outils de la science des données. Mis à jour pour Spark 3.0, ce guide pratique rassemble Spark, des méthodes statistiques et des ensembles de données du monde réel pour t'apprendre à aborder les problèmes d'analyse à l'aide de PySpark, l'API Python de Spark, et d'autres bonnes pratiques de programmation Spark.
Les scientifiques des données Akash Tandon, Sandy Ryza, Uri Laserson, Sean Owen et Josh Wills proposent une introduction à l'écosystème Spark, puis plongent dans des modèles qui appliquent des techniques courantes - notamment la classification, le regroupement, le filtrage collaboratif et la détection d'anomalies - à des domaines tels que la génomique, la sécurité et la finance. Cette édition mise à jour couvre également le NLP et le traitement des images.
Si tu as des connaissances de base en apprentissage automatique et en statistiques et que tu programmes en Python, ce livre te permettra de te lancer dans l'analyse de données à grande échelle.
- Familiarise-toi avec le modèle de programmation et l'écosystème de Spark.
- Apprends les approches générales de la science des données.
- Examiner des implémentations complètes qui analysent de grands ensembles de données publiques.
- Découvre quels outils d'apprentissage automatique sont utiles pour des problèmes particuliers.
- Explorer le code qui peut être adapté à de nombreuses utilisations.
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access