
机器学习概览
|
37
人均 GDP
(
美元
)
生活满意度
全部数据上的线性模型
部分数据上的线性模型
部分数据上的归一化线性模型
图 1-23:正则化降低了过拟合的风险
1.5.6 欠拟合训练数据
你可能已经猜到了,欠拟合和过拟合正好相反。它的产生通常是因为对于底层的数据结
构来说,你的模型太过简单。例如,用线性模型来描述生活满意度就属于欠拟合。现实
情况远比模型复杂得多,所以即便是对于用来训练的示例,该模型产生的预测都一定是
不准确的。
解决这个问题的主要方式有:
•
选择一个带有更多参数、更强大的模型。
•
给学习算法提供更好的特征集(特征工程)。
•
减少模型中的约束(例如,减少正则化超参数)。
1.5.7 退后一步
现在你已经对机器学习有了一定了解。不过讲了这么多概念,你可能有点晕,我们暂且
退后一步,纵观一下全局:
•
机器学习是关于如何让机器可以更好地处理某些特定任务的理论,它从数据中学习,
而无须清晰地编码规则。
•
机器学习系统有很多类型:有监督和无监督,批量的和在线的,基于实例的和基于
模型的,等等。
•
在一个机器学习项目中,你从训练集中采集数据,然后将数据交给学习算法来计算。
如果算法是基于模型的,它会调整一些参数来将模型适配于训练集(即对训练集本
身做出很好的预测),然后算法就可以对新的场景做出合理的预测。如果算法是基于
实例的,它会记住这些示例,并根据相似度度量将它们与所学的实例进行比较,从
而泛化这些新实例。