
60
|
第
2
章
现在你可以删除 income_cat 属性,将数据恢复原样了:
for
set_
in
(strat_train_set, strat_test_set):
set_.drop("income_cat", axis=1, inplace=True)
我们花了相当长的时间在测试集的生成上,理由很充分:这是机器学习项目中经常被忽
视但是却至关重要的一部分。并且,当讨论到交叉验证时,这里谈到的许多想法也对其
大有裨益。现在,是时候进入下一个阶段(数据探索)了。
2.4 从数据探索和可视化中获得洞见
到现在为止,我们还只是在快速浏览数据,从而对手头上正在处理的数据类型形成一个
大致的了解。本阶段的目标是再深入一点。
首先,把测试集放在一边,你能探索的只有训练集。此外,如果训练集非常庞大,你可
以抽样一个探索集,这样后面的操作更简单快捷一些。不过我们这个案例的数据集非常
小,完全可以直接在整个训练集上操作。让我们先创建一个副本,这样可以随便尝试而
不损害训练集:
housing = strat_train_set.copy()
2.4.1 将地理数据可视化
由于存在地理位置信息(经度和纬度),因此建立一个各区域的分布图以便于可视化数据
是一个很好的想法(见图 2-11):
housing.plot(kind="scatter", x="longitude", y="latitude")
纬度
经度
图 2-11:数据的地理散点图