给大模型做强化学习,像让学生一边答题、一边根据得分改进;但如果把整套流程都换成更省显存、搬运更快的FP8——一种8位浮点格式——细小的计算误差也会沿管线叠加。论文发现,问题不只在生成答案和训练更新之间的概率对不上:训练中途还可能出现熵异常飙升,也就是模型的选择突然变得过于随机,随后产出乱码。
作者把原因追到“重要性比率”——用来衡量新旧策略概率变化的数值。FP8噪声会扭曲它,让更多负优势词元(效果较差、本应被压低概率的选择)越过允许的更新范围,梯度被错误清零。坏输出因此没有受到惩罚,反而逐步积累。为此,论文提出 Calibrated Clipping:参照高精度BF16的分布,动态校准FP8的裁剪边界。作者称,该方法在GRPO、DAPO两种强化学习算法、8B至32B模型及多种FP8缩放粒度下消除了熵飙升,并恢复到接近BF16基线的表现;这些效果目前来自论文自述。