
无监督学习
|
233
无监督学习与预测
无监督学习可以在预测中发挥重要作用,它既适用于回归问题,也适用于分
类问题。有时候,我们需要在没有任何已标记数据的情况下预测一个分类,
例如,或许我们想根据一组卫星遥感数据预测某个地区的植被情况。鉴于没
有用来训练模型的响应变量,我们可以使用聚类方法来识别出常见模式,并
对地理区域进行分类。
对于“冷启动问题”,聚类是一种尤其重要的工具。在这种问题中,比如启
动一项新的市场营销计划,或者识别出潜在的欺诈或垃圾邮件,在初始阶段
可能没有任何响应变量用于训练模型。随着时间的推移和数据的不断积累,
我们可以学到更多关于系统的信息,并建立一个传统的预测模型。聚类可以
识别出总体中的各个部分,帮助我们更快地开始这个学习过程。
无监督学习的重要性还体现在它可以作为回归和分类方法的一个组成部分。
在处理大数据时,如果一个较小的数据子集在总体数据中没有被很好地表示
出来,那么训练出的模型应用在这个子集上的效果就不会太好。通过聚类,
可以将这些子集识别并标记出来,然后再针对不同的子集拟合独立的模型。
或者,也可以用这种子集本身的特征将其表示出来,强制总体模型将子集的
特征作为一个预测变量。
7.1
主成分分析
通常,变量是一起变化的(共变),而且某个变量的变动实际上就是由另一个变量的变动
而引起的(例如餐馆的账单和小费)。主成分分析(
principal
component analysis
,
PCA
)就
是一种能够发现数值变量如何共变的技术。
1
本节关键术语
主成分
预测变量的一种线性组合。
载荷
将预测变量转换为成分时使用的权重。 ...