
统计机器学习
|
199
表6-2:将表6-1中的房屋所有权因子数据表示为数值型虚拟变量
OWNS_WITH_MORTGAGE OWNS_WITHOUT_MORTGAGE OTHER RENT
1 0 0 0
1 0 0 0
1 0 0 0
1 0 0 0
0 0 0 1
0 0 0 1
在线性回归和逻辑回归中,独热编码会带来多重共线性问题,参见
4.5.2
节。
在这种情况下,可以省略一个虚拟变量(它的值可以根据其他虚拟变量的值
推导出来)。对于
KNN
和本书中讨论的其他方法来说,不存在这个问题。
6.1.4
标准化
(
归一化
,
z
分数
)
在进行测量时,我们通常关心的不是“有多少”,而是关心“与平均水平有多大不同”。
标
准化
(也称为
归一化
)通过减去均值再除以标准差,将所有变量转换为同一尺度,这样,
我们就可以保证某个变量不会单纯地因为它的原始测量尺度而对模型造成过度的影响:
这种转换的结果通常称为
z
分数,这样测量单位就可以统一称为是“距离均值的标准差
数量”。
统计学中的
归一化
(
normalization
)不要与
数据库规范化
(
database normalization
)
相混淆,数据库规范化是指除去数据库中的冗余数据并对数据依赖进行
校验。
对于
KNN
和其他一些方法(例如主成分分析和聚类)来说,在应用之前必须考虑对数据
进行标准化。为了说明这一点,我们在贷款数据上应用
KNN
方法
,使用的变量包括
dti
和
payment_inc_ratio
(参见
6.1.1
节),以及另外两个变量:
revol_bal
,申请人的循环贷
款总额,以美元为单位; ...