
214
Chapitre 8. Réduction de dimension
8.3.7 PCA pour la compression
Il est clair qu’après réduction de dimension, le jeu d’entraînement prend beaucoup
moins de place. Par exemple, recherchez les composantes principales du jeu de
données MNIST qui préservent 95% de sa variance. Vous devriez trouver qu’il
suft de conserver un peu plus de 150 variables, au lieu des 784 variables d’origine.
Ainsi, tout en préservant l’essentiel de la variance, le jeu de données est ramené à
moins de 20% de sa taille d’origine! C’est un taux de compression assez bon qui
permet d’accélérer considérablement un algorithme de classication (tel que SVM
par exemple). ...