
266
|
第
7
章
本节要点
•
不同数量级的变量需要转换为同一数量级,以使它们对算法的影响不是主要由数量
级决定。
•
常用的缩放方法是归一化(标准化)——减去均值再除以标准差。
•
另一种缩放方法是
Gower
距离,它可以将所有变量缩放到
0
和
1
之间(常用于数值
型数据与分类数据的混合数据)。
7.6
小结
对于数值型数据,数据降维的主要方法是主成分分析和
K-
均值聚类。这两种方法都需要对
数据进行适当的缩放,以确保数据降维有意义。
在高度结构化的数据中,簇的分离度非常好,这时所有聚类方法都会得到类似的结果。每
种方法都有其优点。
K-
均
值非常容易理解,可以扩展到规模非常大的数据上。层次聚类可
用于混合数据类型(数值型和分类型),可以进行直观的表示(树状图)。基于模型的聚类
与启发式方法不同
,它建立在统计学理论之上,可以提供更加严谨的聚类方法。不过,对
于规模非常大的数据,
K-
均值是主要的方法。
对于有噪声的数据,比如贷款数据和股票数据(以及数据科学家们面对的很多数据),聚
类方法的选择更加困难。使用
K-
均值
、层次聚类,尤其是基于模型的聚类,会得到迥异的
结果。那么,数据科学家们应该如何应对呢?遗憾的是,没有某种简单的经验法则来指导
这种选择。最终使用哪种方法,还是要根据数据规模和应用目标来决定。