
211
第 9 章
无监督学习技术
尽管今天机器学习的大多数应用都是基于有监督学习的(因此,这是大多数投资的方
向),但是绝大多数可用数据都没有标签:我们具有输入特征
X
,但是没有标签
y
。计算
机科学家 Yann LeCun 曾有句著名的话:“如果智能是蛋糕,无监督学习将是蛋糕本体,
有监督学习是蛋糕上的糖霜,强化学习是蛋糕上的樱桃。”换句话说,无监督学习具有
巨大的潜力,我们才刚刚开始研究。
假设你要创建一个系统,该系统将在制造生产线上为每个产品拍摄几张图片,并检测哪
些产品有缺陷。你可以相当容易地创建一个自动拍照系统,这可能每天为你提供数千张
图片。然后,你可以在几周内构建一个相当大的数据集。但是,等等,没有标签!如果
你想训练一个常规的二元分类器来预测某件产品是否有缺陷,则需要将每张图片标记为
“有缺陷”或“正常”。这通常需要人类专家坐下来并手动浏览所有图片。这是一项漫长、
昂贵且烦琐的任务,因此通常只能在可用图片的一部分上完成。因此,标记的数据集将
非常小,并且分类器的性能将令人失望。而且,公司每次对其产品进行任何更改时,都
需要从头开始整个过程。如果该算法只需要利用未标记的数据而无须人工标记每张图
片,那不是很好吗?让我们进入无监督学习。
在第 8 章中,我们研究了最常见的无监督学习任务:降维。在本章中,我们将研究其他
一些无监督的学习任务和算法:
聚类
目标是将相似的实例分组到集群中。聚类是很好的工具,用于数据分析、客户细
分、推荐系统、搜索引擎、图像分割、半监督学习、降维等。
异常检测
目的是学习“正常”数据看起来是什么样的,然后将其用于检测异常情况 ...