
222
|
第
9
章
集群
图 9-10:各种
K
值的轮廓图分析(续)
垂直虚线表示每个集群的轮廓分数。当集群中的大多数实例的系数均低于此分数时(如
果许多实例在虚线附近停止,在其左侧结束),则该集群比较糟糕,因为这意味着其实例
太接近其他集群了。可以看到,当
k
= 3 或者
k
= 6 时,我们得到了不好的集群。但是当
k
= 4 或
k
= 5 时,集群看起来很好:大多数实例都超出虚线,向右延伸并接近 1.0。当
k
= 4 时,索引为 1(从顶部开始的第三个)的集群很大。当
k
= 5 时,所有集群的大小
都相似。因此,即使
k
= 4 的整体轮廓得分略大于
k
= 5 的轮廓得分,使用
k
= 5 来获得
相似大小的集群似乎也是一个好主意。
9.1.2 K-Means 的局限
尽管 K-Means 有许多优点,尤其是快速且可扩展,但它并不完美。如我们所见,必须多
次运行该算法才能避免次优解,此外,你还需要指定集群数,这很麻烦。此外,当集群
具有不同的大小、不同的密度或非球形时,K-Means 的表现也不佳。例如,图 9-11 显示
了 K-Means 如何对包含三个不同尺寸、密度和方向的椭圆形集群的数据集进行聚类。
图 9-11:K-Means 无法正确聚类这些椭圆形集群