同一个 AI 回答,有人觉得很好,也有人觉得很差。传统奖励模型——代替人工反复阅卷的评分器——往往把这些意见压成一个分数,最后只剩下“平均评价”,分歧本身却消失了。
Bingxiang He 提出的 DRM(Diffusion Reward Model,扩散式奖励模型)改为学习一整套可能的评分。它先用冻结的语言模型理解问题和回答,再让轻量的 Diffusion Transformer 从随机噪声出发,多步生成奖励值。这样无需预设评分必须符合某种固定分布,也能表达“有人打高分、有人打低分”的多峰分布。
推理时,DRM 可多次采样,得到平均分、波动程度或较保守的分位数。作者称,在五个奖励模型基准上,它可匹配或超过使用相同数据和语言模型骨干的对照方法;面对重复人工标注,评审分歧越大,模型输出也越呈现多峰。不过,现有材料未给出具体提升数字,实际收益仍以论文自述为限。