
回归与预测
|
141
对于树、聚类和最近邻这样的非线性模型,多重共线性并不是一个严重的问
题,而且在这些方法中,会建议使用
P
个(不是
P
–
1
个)虚拟变量
。尽管
如此,对于这些方法,不包含多余的预测变量仍然是一种好做法。
4.5.3
混淆变量
相关变量的问题是包含了与响应变量具有相似预测关系的不同变量。
混淆变量
的问题则是
在回归方程中没有包含某个重要的变量。这时如果轻率地解释方程系数,就会得出无效的
结论。
以
4.2.1
节中的回归方程
house_lm
为例,其中
SqFtLot
、
Bathrooms
和
Bedrooms
的回归系数
都是负的。初始回归模型中没有包含表示地理位置的变量,而对房价来说,位置是一种非
常重要的预测变量。为了对位置进行建模,我们加入一个
ZipGroup
变量,它将邮政编码分
成了
5
个组,表示从价格最低的区域(
1
)到价格最高的区域(
5
)
5
:
lm(formula = AdjSalePrice ~ SqFtTotLiving + SqFtLot + Bathrooms +
Bedrooms + BldgGrade + PropertyType + ZipGroup, data = house,
na.action = na.omit)
Coefficients:
(Intercept) SqFtTotLiving
-6.666e+05 2.106e+02
SqFtLot Bathrooms
4.550e-01 5.928e+03
Bedrooms BldgGrade
-4.168e+04 9.854e+04 ...