
统计机器学习
|
217
随机森林是一种“黑箱”方法,它可以做出比简单树更为准确的预测,但会丢失简单树的
直观决策规则。随机森林预测总是会有某种程度的噪声:我们可以注意到,有些分数非常
高的借款人,他们的信誉度非常高,但仍然被预测为违约。这是数据中一些特殊记录造成
的结果,说明了随机森林有过拟合的风险(参见
6.1.6
节
)。
6.3.3
变量的重要性
如果用来建立预测模型的数据有很多特征和记录,就能充分展现随机森林算法的威力了,
它可以自动确定哪些预测变量是重要的,也能发现预测变量之间的复杂关系,这对应于交
互项(参见
4.5.4
节)
。以在贷款违约数据上使用所有数据列拟合模型为例,使用的
R
代码
如下所示:
rf_all <- randomForest(outcome ~ ., data=loan_data, importance=TRUE)
rf_all
Call:
randomForest(formula = outcome ~ ., data = loan_data, importance = TRUE)
Type of random forest: classification
Number of trees: 500
No. of variables tried at each split: 4
OOB estimate of error rate: 33.79%
Confusion matrix:
paid off default class.error
paid off 14676 7995 0.3526532 ...