
176
|
第
5
章
处理因子变量
在逻辑回归中,也要像线性回归一样对因子变量进行编码,参见
4.4
节。
在
R
和其他软件中
,一般可以自动完成这个任务,通常使用的是参照编码。在
本章介绍的所有其他分类方法中,通常使用独热编码(参见
6.1.3
节)
。在
Python
的
scikit-learn
中,使用独热编码是最容易的,这意味着在回归中只
使用
n
–1
个最终虚拟变量即可。
5.3.7
评估模型
和其他分类方法一样,逻辑回归也需要通过模型对新数据的分类准确率进行评估(参见
5.4
节)
。和线性回归一样,也有一些标准的统计工具可以用来检验和改善逻辑回归模型。
在系数的估计结果中,
R
给出了系数的标准误差(
SE
)、
z
值和
p
值:
summary(logistic_model)
Call:
glm(formula = outcome ~ payment_inc_ratio + purpose_ + home_ +
emp_len_ + borrower_score, family = "binomial", data = loan_data)
Deviance Residuals:
Min 1Q Median 3Q Max
-2.51951 -1.06908 -0.05853 1.07421 2.15528
Coefficients:
Estimate Std. Error z value Pr(>|z|)
(Intercept) 1.638092 0.073708 22.224 < 2e-16 ***
payment_inc_ratio ...