
242
|
第
9
章
图 9-23:在同一数据上使用不同的先验集中度会导致不同数量的集群
公式 9-2:贝叶斯定理
pz X(| )= = =后验
概率 先验
证据
× pX z pz( | ) ()
pX()
不幸的是,在高斯混合模型(以及许多其他问题)中,分母
p
(
X
) 很难处理,因为它需要
对
z
的所有可能值进行积分(见公式 9-3),这需要考虑所有可能的集群参数和集群分配
的组合。
公式 9-3:证据
p
(
X
) 是难处理的
pX PX zpz z( ) ( | ) ( )d=
∫
这种难处理性是贝叶斯统计中的核心问题之一,有几种解决方法。其中之一是变分推
理,它选择具有变分参数
λ
的分布族
q
(
z
;
λ
),然后优化这些参数以使
q
(
z
) 成为
p
(
z
|
X
) 的
良好近似值。这是通过找到最小化从
q
(
z
) 到
p
(
z
|
X
) 的 KL 散度的
λ
值来实现的,记为
D
KL
(
q
||
p
)。KL 散度方程如公式 9-4 所示,可以将其重写为证据的对数(log
p
(
X
))减去
证据的下界(ELBO)。由于证据的对数不依赖于
q
,它是一个常数项,因此,使 KL 散
度最小化只需要使 ELBO 最大化。
公式 9-4:从
q
(
z
) 到
p
(
z
|
X
) 的 KL 散度
D qp
KL
( || ) log
= −
= −
=
q
q
q
[log ( ) log ( | )]
log ( ) log
qp
q
p
z zX
(| )
q
z
zX
()z
p
p
(| )zX
()X