Chapitre 4. Faire des prédictions avec les arbres de décisionet les forêts de décision
La classification et la régression sont les types d'analyse prédictive les plus anciens et les plus étudiés. La plupart des algorithmes que tu rencontreras probablement dans les progiciels d'analyse et les bibliothèques sont des techniques de classification ou de régression, comme les machines à vecteurs de support, la régression logistique, les réseaux neuronaux et l'apprentissage profond. Le point commun entre la régression et la classification est qu'il s'agit dans les deux cas de prédire une (ou plusieurs) valeur(s) à partir d'une (ou plusieurs) autre(s) valeur(s). Pour ce faire, tous deux ont besoin d'un ensemble d'entrées et de sorties à partir desquelles apprendre. Ils ont besoin d'être alimentés à la fois en questions et en réponses connues. C'est pourquoi on les appelle des types d'apprentissage supervisé.
PySpark MLlib propose des implémentations d'un nombre d'algorithmes de classification et de régression. Il s'agit notamment des arbres de décision, des Bayes naïfs, de la régression logistique et de la régression linéaire. Ce qui est passionnant avec ces algorithmes, c'est qu'ils peuvent aider à prédire l'avenir - ou du moins, à prédire les choses que nous ne savons pas encore avec certitude, comme la probabilité que tu achètes une voiture en fonction ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access