
148
|
第
4
章
显然,在回归中有几个数据点产生了很强的影响。可以使用
cooks.distance
函数计算库克
距离,使用
hatvalues
函数计算帽子值。
x
轴绘制出了帽子值,
y
轴绘制出了残差,数据点
的大小表示出了库克距离。
表
4-2
比较了全数据集回归和去掉了高影响数据点(库克距离大于
0.08
)的回归。
表4-2:全数据回归系数与去掉高影响数据之后的回归系数
原始数据 去掉高影响数据后
截距
–772 550 –647 137
SqFtTotLiving
210 230
SqFtLot
39 33
Bathrooms
2282 –16 132
Bedrooms
–26 320 –22 888
BldgGrade
130 000 114 871
变量
Bathrooms
的系数发生了巨大变化。
7
如果想拟合能可靠地预测未来数据的回归模型,那么只有在小型数据集中,找出强影响观
测才有意义。对于使用了很多记录拟合的回归,不太可能有哪个观测的权重大到对拟合公
式产生极端的影响(虽然回归中还是会有较大的异常值)。不过,如果想进行异常检测,
找出高影响的观测就是非常重要的。
4.6.3
异方差
、
非正态与相关误差
统计学家非常关注残差的分布。研究表明,普通最小二乘法(参见
4.1.3
节)是无偏的,
而且在某些情况下,如果有一系列分布假设,它还是“最优”的估计方法。这意味着在多
数问题中,数据科学家不需要过于关心残差的分布。
残差分布主要与正式统计推断(假设检验与
p
值)的有效性相关
,对于主要关心预测精确
度的数据科学家来说,它的重要性微乎其微。正态分布的误差是模型成功完成的一种标志。 ...