
108
第 4 章
训练模型
到目前为止,我们已经探讨了不同机器学习的模型,但是它们各自的训练算法在很大程
度上还是一个黑匣子。回顾前几章里的部分案例,你大概感到非常惊讶,在对系统内部
一无所知的情况下,居然已经实现了这么多:优化了一个回归系统,改进了一个数字图
片分类器,从零开始构建了一个垃圾邮件分类器,所有这些,你都不知道它们实际是如
何工作的。确实是这样,在许多情况下,你并不需要了解实施细节。
但是,很好地理解系统如何工作也是非常有帮助的。针对你的任务,它有助于快速定位
到合适的模型、正确的训练算法,以及一套适当的超参数。不仅如此,后期还能让你
更高效地执行错误调试和错误分析。最后还要强调一点,本章探讨的大部分主题对于理
解、构建和训练神经网络(本书第二部分)是至关重要的。
本章我们将从最简单的模型之一
—
线性回归模型,开始介绍两种非常不同的训练模型
的方法:
•
通过“闭式”方程,直接计算出最拟合训练集的模型参数(也就是使训练集上的成
本函数最小化的模型参数)。
•
使用迭代优化的方法,即梯度下降(GD),逐渐调整模型参数直至训练集上的成本
函数调至最低,最终趋同于第一种方法计算出来的模型参数。我们还会研究几个梯
度下降的变体,包括批量梯度下降、小批量梯度下降以及随机梯度下降。等我们进
入到第二部分神经网络的学习时,会频繁地使用这几个的变体。
接着我们将会进入多项式回归的讨论,这是一个更为复杂的模型,更适合非线性数据
集。由于该模型的参数比线性模型更多,因此更容易造成对训练数据过拟合,我们将使
用学习曲线来分辨这种情况是否发生。然后 ...