
端到端的机器学习项目
|
77
习算法的好方法。这里我们将跳过大部分代码,因为与其他模型基本相同:
>>> from sklearn.ensemble import
RandomForestRegressor
>>>
forest_reg = RandomForestRegressor()
>>>
forest_reg.fit(housing_prepared, housing_labels)
>>>
[...]
>>>
forest_rmse
18603.515021376355
>>>
display_scores(forest_rmse_scores)
Scores: [49519.80364233 47461.9115823 50029.02762854 52325.28068953
49308.39426421 53446.37892622 48634.8036574 47585.73832311
53490.10699751 50021.5852922 ]
Mean: 50182.303100336096
Standard deviation: 2097.0810550985693
哇,这个就好多了:随机森林看起来很有戏。但是,请注意,训练集上的分数仍然远低
于验证集,这意味着该模型仍然对训练集过拟合。过拟合的可能解决方案包括简化模
型、约束模型(即使其正规化),或获得更多的训练数据。不过在深入探索随机森林之
前,你应该先尝试一遍各种机器学习算法的其他模型(几种具有不同内核的支持向量机,
比如神经网络模型等 ...