
分类
|
165
判别函数
应用于预测变量,使类别之间的区别最大化的函数。
判别权重
使用判别函数得到的一种分数,用来估计记录属于某种类别的概率。
尽管判别分析中包含了多种技术,但最常使用的还是
线性判别分析
(
linear discriminant
analysis
,
LDA
)
。实际上,
R. A. Fisher
最初提出的方法与
LDA
稍微有些差别,但基本机
制是一样的。随着更高级技术(比如树模型和逻辑回归)的出现,
LDA
现
在的使用已经不
是那么广泛了。
不过,你还是会在一些应用中遇到
LDA
,
它与其他使用得更加广泛的方法(如主成分分
析,参见
7.1
节)也有联系。
不可将线性判别分析与隐狄利克雷分配(
Latent Dirichlet Allocation
,也简称
LDA
)相
混淆。隐狄利克雷分配用于文本和自然语言处理,与线性判别分析
没有关系。
5.2.1
协方差矩阵
要理解判别分析,我们必须先介绍一下两个或多个变量之间的
协方差
这个概念。协方差测
量的是两个变量
x
和
z
之间的关系。
和
表示每个变量的均值(参见
1.3.1
节 )。
x
和
z
之间的协方差
s
x, z
如下所示:
1
,
( )( )
n
i
xz
x xz z
s
=
=
−
其中
n
是记录的数量(注意分母是
n
–1
,不是
n
,参见
1.4.1
节
)。
与相关系数(参见
1.7
节)一样
,正的协方差表示变量之间存在正向关系,负的协方差表
示变量之间存在负向关系。不过,相关系数被限制在
–1
和
1
之间
,而协方差的值是由
x
和
z
的值决定的。在
x
和
z
的
协方差矩阵
Σ
中,对角线(行和列都是同一个变量)上是每 ...