
168
|
第
6
章
称为正则化。正则化超参数的选择取决于使用的模型,但是通常来说,至少可以限制决
策树的最大深度。在 Scikit-Learn 中,这由超参数 max_depth 控制(默认值为 None,
意味着无限制)。减小 max_depth 可使模型正则化,从而降低过拟合的风险。
DecisionTreeClassifier 类还有一些其他的参数,同样可以限制决策树的形状:
min_samples_split(分裂前节点必须有的最小样本数)、min_samples_leaf(叶
节点必须有的最小样本数量)、min_weight_fraction_leaf(与 min_samples_
leaf 一样,但表现为加权实例总数的占比)、max_leaf_nodes(最大叶节点数量),
以及 max_features(分裂每个节点评估的最大特征数量)。增大超参数 min_* 或减
小 max_* 将使模型正则化。
还可以先不加约束地训练模型,然后再对不必要的节点进行剪枝(删除)。如
果一个节点的子节点全部为叶节点,则该节点可被认为不必要,除非它所表示
的纯度提升有重要的统计意义。标准统计测试(比如
χ
2
测试)用来估算“提升
纯粹是出于偶然”(被称为零假设)的概率。如果这个概率(称之为
p
值)高
于一个给定阈值(通常是 5%,由超参数控制),那么这个节点可被认为不必
要,其子节点可被删除。直到所有不必要的节点都被删除,剪枝过程结束。
图 6-3 显示了在卫星数据集上训练的两个决策树(在第 5 章中介绍)。左侧使用默认的 ...