
192
|
第
5
章
图 5-8:比较四种方法的分类规则
在更高维度上可视化这样的预测规则非常困难,对于
GAM
和树模型,即使是为这些规则
生成区域也很不容易。
在任何情况下,对预测值的探索性分析都是有必要的。
本节要点
•
高度不平衡的数据(即我们感兴趣的结果
1
的数量很稀少)对于分类算法来说是个
问题。
•
处理不平衡数据的一种策略是,通过对冗余记录进行欠采样(或对稀有类记录进行
过采样)来平衡训练数据。
•
如果使用了所有的
1
还觉得不够,可以对稀有类进行
Bootstrap
抽样,或使用
SMOTE
算法创建与现有稀有类数据相似的合成数据。
•
非平衡数据通常表明正确分类出
1
的价值较高,而且这种价值比率应该反映在评估
指标中。
5.5.6
扩展阅读
•
《商战数据挖掘》
6
一书的作者
Tom Fawcett
写了一篇关于非平衡类的精彩文章:“
Learning
from Imbalanced Classes
”。
注
6
:
该书已由人民邮电出版社出版,详见
ituring.cn/book/1262
。——编者注