
173
第 7 章
集成学习和随机森林
如果你随机向几千个人询问一个复杂问题,然后汇总他们的回答。在许多情况下,你会
发现,这个汇总的回答比专家的回答还要好,这被称为群体智慧。同样,如果你聚合一
组预测器(比如分类器或回归器)的预测,得到的预测结果也比最好的单个预测器要好。
这样的一组预测器称为集成,所以这种技术也被称为集成学习,而一个集成学习算法则
被称为集成方法。
例如,你可以训练一组决策树分类器,每一棵树都基于训练集不同的随机子集进行训
练。做出预测时,你只需要获得所有树各自的预测,然后给出得票最多的类别作为预测
结果(见第 6 章练习题 8 )。这样一组决策树的集成被称为随机森林,尽管很简单,但它
是迄今可用的最强大的机器学习算法之一。
此外,正如我们在第 2 章讨论过的,在项目快要结束时,你可能已经构建好了一些不错
的预测器,这时就可以通过集成方法将它们组合成一个更强的预测器。事实上,在机器
学习竞赛中获胜的解决方案通常都涉及多种集成方法(最知名的是 Nerflix 大奖赛)。
本章我们将探讨最流行的几种集成方法,包括 bagging、boosting、stacking 等,也将探
索随机森林。
7.1 投票分类器
假设你已经训练好了一些分类器,每个分类器的准确率约为 80%。大概包括一个逻辑回
归分类器、一个 SVM 分类器、一个随机森林分类器、一个 K- 近邻分类器,或许还有更
多(见图 7-1)。
这时,要创建出一个更好的分类器,最简单的办法就是聚合每个分类器的预测,然
后将得票最多的结果作为预测类别。这种大多数投票分类器被称为硬投票分类器(见 ...