
180
|
第
7
章
是对特征进行抽样(即 bootstrap_features=True 并且 / 或 max_features<1.0),
这被称为随机子空间法
注 8
。
1
对特征抽样给预测器带来更大的多样性,所以以略高一点的偏差换取了更低的方差。
7.4 随机森林
前面已经提到,随机森林
注 9
是决策树的集成,通常用 bagging(有时也可能是 pasting)方
法训练,训练集大小通过 max_samples 来设置。除了先构建一个 BaggingClassifier 然
后将其传输到 DecisionTreeClassifier,还有一种方法就是使用 RandomForest-
Classifier 类,这种方法更方便,对决策树更优化
注 10
(同样,对于回归任务也有一
个 RandomForestRegressor 类)。以下代码使用所有可用的 CPU 内核,训练了一个
拥有 500 棵树的随机森林分类器(每棵树限制为最多 16 个叶节点):
23
from sklearn.ensemble import
RandomForestClassifier
rnd_clf = RandomForestClassifier(n_estimators=500, max_leaf_nodes=16, n_jobs=-1)
rnd_clf.fit(X_train, y_train)
y_pred_rf = rnd_clf.predict(X_test)
除少数例外,RandomForestClassifier 具有 ...