
无监督学习
|
253
结果迥然不同。单距离法几乎将所有点聚成了一个簇。除了最小方差法(
R
:
Ward.D
;
Python
:
ward
),所有测量方法都得到了至少一个仅有少量离群点的簇。与图
7-5
相比,最
小方差法与
K-
均值得到的簇是最相似的。
本节要点
•
层次聚类开始时,每条记录作为一个簇。
•
簇逐步与其附近的簇合并,直到所有记录都属于一个簇(凝聚算法)。
•
凝聚的过程被保留并绘制出来。不用事先确定簇的数目,用户可以将不同阶段簇的
数目和结构形象地表示出来。
•
簇间距离可以使用不同方法进行计算,所有方法都基于簇内记录之间的距离。
7.4
基于模型的聚类
像层次聚类和
K-
均值这样的聚类方法都是基于某种启发式规则的,它们的基本原理是找
出成员之间彼此邻近的簇,这种邻近关系是通过数据直接测量的(不涉及任何概率模型)。
在过去
20
年
中,人们为开发
基于模型的聚类
方法做了大量工作。华盛顿大学的
Adrian
Raftery
及其他研究者对这种聚类方法做出了突出的贡献
,他们的贡献不但有理论上的,还
包括开发了实际的软件。基于模型的聚类方法基于统计学理论,提供了更加严谨的方法来
确定簇的本质和数量。例如,有一组记录彼此非常相似但并不邻近(如收益方差非常大的
高科技类股票),另外一组记录既相似也邻近(如方差很小的公益事业类股票),在这种情
况下,就可以使用基于模型的聚类方法。
7.4.1
多元正态分布
使用最为广泛的基于模型的聚类方法是建立在多元正态分布的基础之上的。
多元正态分布
(
multivariate
normal distribution ...