Chapitre 5. Détection des anomalies avec le regroupement par K-means
La classification et la régression sont des techniques puissantes et bien étudiées de l'apprentissage automatique. Le chapitre 4 a montré comment utiliser un classificateur pour prédire des valeurs inconnues. Mais il y avait un hic : pour prédire des valeurs inconnues pour de nouvelles données, nous devions connaître les valeurs cibles pour de nombreux exemples vus précédemment. Les classificateurs ne peuvent aider que si nous, les scientifiques des données, savons ce que nous cherchons et pouvons fournir de nombreux exemples où les données d'entrée ont produit une sortie connue. Ces techniques étaient collectivement connues sous le nom de techniques d'apprentissage supervisé, car leur processus d'apprentissage reçoit la valeur de sortie correcte pour chaque exemple en entrée.
Cependant, il arrive que la sortie correcte soit inconnue pour une partie ou la totalité des exemples. Considère le problème de la répartition des clients d'un site de commerce électronique en fonction de leurs habitudes d'achat et de leurs goûts. Les caractéristiques d'entrée sont leurs achats, leurs clics, leurs informations démographiques, etc. Le résultat devrait être des groupes de clients : peut-être qu'un groupe représentera les acheteurs soucieux de la mode, un autre correspondra aux chasseurs de bonnes ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access