概率分布与相关概念解析
1. 贝叶斯学习中的不确定性变化
在贝叶斯学习中,对于有限数据集,参数 $\mu$ 的后验均值总是介于先验均值和与事件相对频率对应的 $\mu$ 的最大似然估计之间。从图中可以观察到,随着观测数量的增加,后验分布会变得更加尖锐。这也可以从贝塔分布的方差结果(2.16)看出,当 $a \to \infty$ 或 $b \to \infty$ 时,方差趋近于零。
为了探讨随着数据增多,后验分布所代表的不确定性是否会稳步降低这一问题,我们可以从频率主义的角度来看待贝叶斯学习。考虑一个一般的贝叶斯推理问题,对于参数 $\theta$,我们观测到数据集 $D$,其联合分布为 $p(\theta, D)$。有如下结果:
- $E_{\theta}[\theta] = E_{D} [E_{\theta}[\theta|D]]$ (2.21)
- 其中,$E_{\theta}[\theta] \equiv \int p(\theta)\theta d\theta$ (2.22)
- $E_{D}[E_{\theta}[\theta|D]] \equiv \int \left{\int \theta p(\theta|D) d\theta\right} p(D) dD$ (2.23)
这个结果表明,$\theta$ 的后验均值在生成数据的分布上的平均值等于 $\theta$ 的先验均值。
同时,我们还能得到:
- $var_{\theta}[\theta] = E_{D} [var_{\theta}[\theta|D]] + var_{D} [E_{\theta}[\theta|D]]$ (2.24)
等式左边是
超级会员免费看
订阅专栏 解锁全文

443

被折叠的 条评论
为什么被折叠?



