
208
|
第
6
章
假设我们有一个响应变量
Y
和含有
P
个预测变量
X
j
的集合,
j
=
1,
…
,
P
。对于分区
A
中的
记录,递归分割会找到将分区
A
划分为两个子分区的最佳方式。
1.
对于每个预测变量
X
j
:
a.
对于
X
j
的每个值
s
j
,
i.
将
A
中的记录分割为两部分
,其中
X
j
的值小于
s
j
的记录在一个分区,其余
X
j
的值
大于等于
s
j
的记录在另一个分区。
ii.
测量出
A
的每个子分区中的类别的同质性。
b.
选择能使分区内类别同质性最大的
s
j
的值。
2.
选择出能使分区内类别同质性最大的变量
X
j
和分割值
s
j
。
下面是递归环节。
1.
对
A
进行初始化,即将整个数据集作为
A
。
2.
应用分割算法将
A
分割为两个子分区
A
1
和
A
2
。
3.
在子分区
A
1
和
A
2
上重复第
2
步。
4.
当进一步分区不能提高分区同质性时,算法结束。
最终的结果是一些数据分区,就像图
6-4
中那样
,只不过是
P
维的。按照分区中响应变量
少数服从多数的投票结果,每个分区还预测了
0
或
1
的结果。
除了预测
0/1
二元结果,树模型还可以根据分区中
0
和
1
的数量生成一个概率
估计。这种估计只是简单地用分区中
0
或
1
的数量除以分区中的观测总数。
1
Prob(1)Y ==
ݴ൶ዐ ڦຕଉ
ݴ൶ඹଉ
估计出的
Prob(
Y
=
1)
可以转换为一个二元决策。例如,如果
Prob(
Y
=
1) > 0.5
,
就将估计值设置为
1
。
6.2.3
测量同质性或不纯度
树模型递归地创建数据分区
A
(记录集合),这种分区可以预测
Y
=
1
或
Y
=
0
的结果。从
上面的算法可知,我们需要一种测量分区中同质性(也称为 ...