决策树基尼杂质基础数学Q

bam*_*222 1 math machine-learning probability decision-tree

假设您有 3 类球:红色、绿色、蓝色。

出现任何彩色球的几率是红色 = 4/10,蓝色 = 3/10,绿色 = 3/10

错误分类红色的计算方法为 4/10*(3/10 + 3/10) 或选择“真实类别”*“错误类别”的几率。

为什么要乘以而不是说加来找出选错红球的几率?我知道基尼杂质方程将这个基本思想概括为所有 C 类,每个类的 N 点和 Ni 数据点。我想我忘记了我的基本概率直觉。

ric*_*ici 5

一个球的概率red是 0.4。如果球实际上是红色的,您只能对红球犯错误。

假设猜测完全基于球的概率分布 [注 1],那么猜测蓝色的概率为 0.3,同样猜测绿色的概率为 0.3。如果球真的是红色的,那么这些都是错误的猜测,因为唯一可能的猜测是正确的。

如果两个事件是独立的,则它们都发生的概率(P和Q)是它们概率的乘积。如果两个事件是互斥的,那么其中一个发生的概率(P或Q)是它们概率的总和。

所以一个球是红色的并且被错误分类(蓝色或绿色)的概率是 0.4 * (0.3 + 0.3)。

为此,我们必须加上蓝球被错误分类为红色或绿色的概率 (0.3 * (0.4 + 0.3)) 和绿球被错误分类为蓝色或红色的概率 (0.3 * (0.3 + 0.4) )) 总计 0.66。这非常接近最大值 2/3(当所有概率都相等时)。


笔记:

  1. 在这里,我根据维基百科对基尼杂质的定义给出答案:

    Gini 杂质是衡量如果根据子集中标签的分布随机标记从集合中随机选择的元素被错误标记的频率。