在强化学习领域,我们常常面临一个看似简单的选择:如何设计一个合理的奖励函数?当我在实际项目中首次接触On-Policy Distillation(OPD)时,最让我困惑的正是这个看似基础的数学公式——log(π_T/π_θ)。表面上看,它优雅地表达了教师模型与学生模型之间的概率差异,但当我深入分析训练过程中的梯度波动和模型行为时,却发现这个设计背后隐藏着严重的问题。
1. 为什么OPD的log比率奖励本质上是不稳定的
1.1 从实际训练现象看问题本质
在我最近的一个数学推理蒸馏项目中,使用Qwen3-1.7B作为学生模型,Qwen3-4B作为教师模型,观察到了典型的OPD训练病理现象。训练初期,验证准确率不仅没有提升,反而出现了明显的下降,直到约300个训练步骤后才开始恢复。更令人担忧的是,验证集上的平均响应长度出现了大幅振荡,模型在生成行为上表现出明显的不稳定性。
这种现象背后的核心原因是OPD奖励的极端方差。通过分析训练过程中token级别的奖励分布,发现OPD奖励的取值范围极其广泛,负向尾部甚至接近-50。这种高方差分布直接源于log差异的数学特性——它能够将教师-学生概率差异放大为无界的奖励幅度。
1.2 无界奖励的数学根源
OPD奖励函数rtOPD = log(π_T/π_θ)在数学上存在两个方向的发散问题:当学生模型对某个token的概率π_θ趋近于0时,奖励趋向正无穷;当教师模型概率π_T趋近于0时,奖励趋向负无穷。在实际的on-policy训练中,学生模型采样的token往往在其自身概率分布下具有较高概率,但教师模型可能对这些token赋予较低概率,这就导致奖励很容易进入负向发散区域。
从梯度更新的角度看,政策梯度更新直接由奖励标量缩放。极端OPD奖励人为地放大了梯度方差,使得优化过程变得异常脆弱。特别是在生成长文本时,早期token的不稳定奖励会改变前缀分布,后续的生成又基于这些已偏移的前缀,形成不稳定的反馈循环。
2. 传统后处理稳定化方法的局限性
2.1 三种常见稳定化策略及其缺陷
面对OPD训练的不稳定性,研究者和工程


1736

被折叠的 条评论
为什么被折叠?



