
端到端的机器学习项目
|
53
每一行代表一个区域,总共有10 个属性(在图2-5 中可以看到前6 个 ): longitude
、
latitude
、
housing_median_age
、
total_rooms
、
total_bedrooms
、
population
、
households
、
median_income
、
median_house_value 以及 ocean_proximity。
通过 info() 方法可以快速获取数据集的简单描述,特别是总行数、每个属性的类型和
非空值的数量(见图 2-6)。
图 2-6:住房信息
数据集中包含 20 640 个实例,以机器学习的标准来看,这个数字非常小,但却是个完美
的开始。注意,total_bedrooms 这个属性只有 20 433 个非空值,这意味着有 207 个
区域缺失这个特征。我们后面需要考虑到这一点。
所有属性的字段都是数字,除了 ocean_proximity。它的类型是 object,因此它可
以是任何类型的 Python 对象,不过因为你从 CSV 文件中加载了该数据,所以它必然是
文本属性。通过查看前 5 行,你可能会注意到,该列中的值是重复的,这意味着它有可
能是一个分类属性。你可以使用 value_counts() 方法查看有多少种分类存在,每种
类别下分别有多少个区域:
>>>
housing["ocean_proximity"].value_counts()
<1H OCEAN 9136
INLAND 6551
NEAR OCEAN 2658 ...