
260
|
第
7
章
7.5.1
缩放变量
在应用聚类方法之前,需要对有不同数量级和单位的变量进行适当的归一化。举例来说,
我们在一组贷款违约数据上应用
kmeans
,先不进行归一化处理:
defaults <- loan_data[loan_data$outcome=='default',]
df <- defaults[, c('loan_amnt', 'annual_inc', 'revol_bal', 'open_acc',
'dti', 'revol_util')]
km <- kmeans(df, centers=4, nstart=10)
centers <- data.frame(size=km$size, km$centers)
round(centers, digits=2)
size loan_amnt annual_inc revol_bal open_acc dti revol_util
1 52 22570.19 489783.40 85161.35 13.33 6.91 59.65
2 1192 21856.38 165473.54 38935.88 12.61 13.48 63.67
3 13902 10606.48 42500.30 10280.52 9.59 17.71 58.11
4 7525 18282.25 83458.11 19653.82 11.66 16.77 62.27
下面是对应的
Python
代码:
defaults = loan_data.loc[loan_data['outcome'] ...