
198
|
第
8
章
但是,这种隐含假设并不总是成立。例如,在图 8-6 的下面一行中,决策边界位于
x
1
= 5
处。此决策边界在原始 3D 空间(垂直平面)中看起来非常简单,但在展开流形中看起来
更加复杂(四个独立线段的集合)。
简而言之,在训练模型之前降低训练集的维度肯定可以加快训练速度,但这并不总是会
导致更好或更简单的解决方案,它取决于数据集。
希望现在你对于维度的诅咒有了一个很好的理解,也知道降维算法是怎么解决它的,
特别是当流形假设成立的时候应该怎么处理。本章剩余部分将逐一介绍几个最流行的
算法。
8.3 PCA
主成分分析(PCA)是迄今为止最流行的降维算法。首先,它识别最靠近数据的超平面,
然后将数据投影到其上,如图 8-2 所示。
8.3.1 保留差异性
将训练集投影到低维超平面之前需要选择正确的超平面。例如图 8-7 的左图代表一个简
单的 2D 数据集,沿三条不同的轴(即一维超平面)。右图是将数据集映射到每条轴上的
结果。正如你所见,在实线上的投影保留了最大的差异性,而点线上的投影只保留了非
常小的差异性,虚线上的投影的差异性居中。
图 8-7:选择要投影的子空间
选择保留最大差异性的轴看起来比较合理,因为它可能比其他两种投影丢失的信息更
少。要证明这一选择,还有一种方法,即比较原始数据集与其轴上的投影之间的均方距
离,使这个均方距离最小的轴是最合理的选择,也就是实线代表的轴。这也正是 PCA