CHAPITRE 4 Données manquantes
Nous devons absolument gérer les données manquantes. Nous avons eu un aperçu de la technique dans le précédent chapitre. Entrons plus dans les détails. En effet, lorsqu’il y a des manquants, la plupart des algorithmes ne fonctionnent pas ou mal. Une famille de librairies qui fait exception à cette contrainte est celle des librairies à amplification boosting apparues récemment : XGBoost, CatBoost et LightGBM.
Comme souvent dans le domaine du mécapprentissage (machine learning), il n’y a pas de réponse tranchée pour la gestion des données manquantes, car elles correspondent à des situations variées. Prenons le cas des données d’un recensement dans lequel la caractéristique age reste vide pour certaines personnes. Est-ce ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access