
164
|
第
5
章
5.1.3
数值型预测变量
贝叶斯方法只适用于分类预测变量(比如在垃圾邮件分类中,预测任务的核心是看看是否
存在某些单词、句子或字符)。如果想将朴素贝叶斯应用于数值型预测变量,必须使用以
下两种方法之一。
•
先通过分箱操作将数值型预测变量转换为分类预测变量,然后使用前面介绍的算法。
•
使用一个概率模型,例如正态分布(参见
2.6
节)
,估计条件概率
P
(
X
j
|
Y
=
i
)
。
如果某个预测变量的类别没有出现在训练数据中,则朴素贝叶斯算法会为新
数据的结果变量分配一个
0
概率
,而不是像其他方法那样,简单地忽略这
个变量并使用来自其他变量的信息。多数朴素贝叶斯实现使用一个平滑参数
(拉普拉斯平滑)来防止这种情况。
本节要点
•
朴素贝叶斯方法适用于分类型(因子)预测变量和结果变量。
•
它提出了一个问题:“在每个结果类别中,哪个预测变量类别是最有可能的?”
•
然后,反向使用这种信息,在给定预测变量的值时,估计结果类别的概率。
5.1.4
扩展阅读
• Trevor Hastie
、
Robert Tibshirani
和
Jerome Friedman
合著的《统计学习基础:数据挖掘、
推理与预测(第
2
版
)》。
•
在
Galit
Shmueli
、
Peter Bruce
、
Nitin Patel
、
Peter Gedeck
、
Inbal Yahav
和
Kenneth
Lichtendahl
合著的
Data Mining for Business Analytics
(有
R
、
Python
、
Excel
和
JMP
等
多个版本)一书中,有一章专门介绍了朴素贝叶斯方法。 ...