
第 6章 与学习相关的技巧
176
从图6
-
9 的结果中可知,与
SGD
相比,其他 3 种方法学习得更快,而且
速度基本相同,仔细看的话,
AdaGrad
的学习进行得稍微快一点。这个实验
需要注意的地方是,实验结果会随学习率等超参数、神经网络的结构(几层
深等)的不同而发生变化。不过,一般而言,与
SGD
相比,其他 3 种方法可
以学习得更快,有时最终的识别精度也更高。
6.2
权重的初始值
在神经网络的学习中,权重的初始值特别重要。实际上,设定什么样的
权重初始值,经常关系到神经网络的学习能否成功。本节将介绍权重初始值
的推荐值,并通过实验确认神经网络的学习是否会快速进行。
6.2.1
可以将权重初始值设为0吗
后面我们会介绍抑制过拟合、提高泛化能力的技巧——权值衰减(
weight
decay
)。简单地说,权值衰减就是一种以减小权重参数的值为目的进行学习
的方法。通过减小权重参数的值来抑制过拟合的发生。
如果想减小权重的值,一开始就将初始值设为较小的值才是正途。实际上,
在这之前的权重初始值都是像
0.01 * np.random.randn(10, 100)
这样,使用
由高斯分布生成的值乘以0.01 后得到的值(标准差为 0.01 的高斯分布)。
如果我们把权重初始值全部设为0 以减小权重的值,会怎么样呢?从结
论来说,将权重初始值设为0 不是一个好主意。事实上,将权重初始值设为
0 的话,将无法正确进行学习。
为什么不能将权重初始值设为0 呢?严格地说,为什么不能将权重初始
值设成一样的值呢?这是因为在误差反向传播法中,所有的权重值都会进行 ...