
212
|
第
9
章
密度估算
这是估计生成数据集的随机过程的概率密度函数(PDF)的任务,密度估算通常用
于异常检测:位于非常低密度区域的实例很可能是异常。它对于数据分析和可视化
也很有用。
准备好蛋糕了吗?我们将从使用 K-Means 和 DBSCAN 进行聚类开始,然后讨论高斯混
合模型,并了解如何将它们用于密度估计、聚类和异常检测。
9.1 聚类
你在山中徒步旅行时,偶然发现了从未见过的植物。你环顾四周,发现还有很多。它们
并不完全相同,但是它们足够相似,你可能知道它们有可能属于同一物种(或至少属于
同一属)。你可能需要植物学家告诉你什么是物种,但你当然不需要专家来识别外观相
似的物体组。这称为聚类:识别相似实例并将其分配给相似实例的集群或组。
就像在分类中一样,每个实例都分配给一个组。但是与分类不同,聚类是一项无监督任
务。考虑图 9-1:左侧是鸢尾花数据集(在第 4 章中介绍),其中每个实例的种类(即类)
用不同的标记表示。它是一个标记的数据集,非常适合使用逻辑回归、SVM 或随机森
林分类器等分类算法。右侧是相同的数据集,但是没有标签,因此你不能再使用分类算
法。这就是聚类算法的引入之处,它们中的许多算法都可以轻松检测左下角的集群。肉
眼也很容易看到,但是右上角的集群由两个不同的子集群组成,并不是很明显。也就是
说,数据集具有两个附加特征(萼片长度和宽度),此处未表示,并且聚类算法可以很好
地利用所有的特征,因此实际上它们可以很好地识别三个聚类(例如,使用高斯混合模
型,在 150 个实例中,只有 5 ...