
第 6章 与学习相关的技巧
198
这里介绍的超参数的最优化方法是实践性的方法。不过,这个方
法与其说是科学方法,倒不如说有些实践者的经验的感觉。在超
参数的最优化中,如果需要更精炼的方法,可以使用贝叶斯最优
化(Bayesian optimization)。贝叶斯最优化运用以贝叶斯定理为中
心的数学理论,能够更加严密、高效地进行最优化。详细内容请
参 考 论 文“Practical Bayesian Optimization of Machine Learning
Algorithms”
[16]
等。
6.5.3
超参数最优化的实现
现在,我们使用
MNIST
数据集进行超参数的最优化。这里我们将学习
率和控制权值衰减强度的系数(下文称为“权值衰减系数”)这两个超参数的
搜索问题作为对象。这个问题的设定和解决思路参考了斯坦福大学的课程
“
CS231n
”。
如前所述,通过从0.001(10
−3
)到 1000(10
3
)这样的对数尺度的范围
中随机采样进行超参数的验证。这在
Python
中可以写成
10 ** np.random.
uniform(-3, 3)
。在该实验中,权值衰减系数的初始范围为10
−8
到 10
−4
,学
习率的初始范围为10
−6
到10
−2
。此时,超参数的随机采样的代码如下所示。
weight_decay = 10 ** np.random.uniform(-8, -4)
lr = 10 ** np.random.uniform(-6, -2)
像这样进行随机采样后,再使用那些值进行学习。之后,多次使用各种 ...