你给学生准备了一整套习题。第一周,基础题值得多做;一个月后还反复练这些题,收益就很小。难题也不是越早做越好:完全无从下手时,它可能只会制造混乱。训练 AI 也有类似问题。题目的价值会随能力变化,但许多训练方法仍在开始前一次性决定哪些题重要。
Haoru Tan 提出的 Dynamic Important Example Mining(DIEM,动态重要样本挖掘),想把这件事改成边练边调整。它用于强化微调(Reinforcement Fine-tuning,RFT)——模型先回答问题,根据答案获得奖励或扣分,再用反馈调整自身。DIEM 不会生成新题,也不是让模型在整个题库里自由挑题。更准确地说,它在每一步训练中估计当前批次里各道题的价值,再改变它们对这次更新的影响。
所有效果数字均来自论文作者的实验,尚无独立复现。
题目的价值不是固定标签
训练预算有限,样本选择回答的是一个很实际的问题:此刻应该把算力花在哪些题上?过易的题可能已经没有新信息,过难的题又可能只带来噪声。
以往的静态方法会在训练前筛一次题。例如 HVS 根据奖励波动挑选样本,LIMR 根据奖励趋势的变化判断改进空间。另一些动态方法会随训练调整顺序:PCL 另训一个价值模型来估计难度,SPEED-RL 则偏向通过率居中的题。
论文认为,难度或通过率只是外部指标。它们没有直接回答:这道题会把当前模型往什么方向推,又会给眼下这一步带来多少额外收益。
这里牵涉到“非平稳性”(Non-stationarity):同一道题的训练价值会变。模型今天不会,明天可能已经熟练;一个固定分数很难贯穿整个训练过程。DIEM 因此不把“重要”当成题目自带的永久标签,而把它看成题目、模型状态与训练时刻共同决定的临时判断。
它怎样判断“现在值得练”
DIEM 的理想定义很直观:先用完整批次更新一次模型,再假想拿掉其中某个样本重新更新;如果拿掉后,更新所得模型在原批次上的总奖励更差,这个样本此刻就有正贡献。反之,它可能正在把模型带偏。
问题是,逐题删除并重新训练代价太高。DIEM 改用 gradient alignment(梯度对齐)近似判断。梯度可以理解为每道题建议模型参数移动的方向。系统比较单个样本的方向与整个批次合成方向:两者越一致,样本的重要性分数越高;若方向相反,分数为负,说明它可能拖慢或干扰这一步更新。
论文还给出了近似误差的理论上界,并称所需梯度信息来自常规 RFT 的反向传播过程。不过,这只解决了“怎样打分”,还没有解决“该给多少权重”。
重排轻重,还要管住步幅
如果只把最高分样本猛然放大,训练更新也可能忽大忽小。DIEM 的第二步是 constrained batch reweighting(受约束的批次重加权):在提高整批样本总效用的同时,要求重新加权后的总体梯度幅度与原来一致。
可以把它理解为重新分配一堂课的时间,但不延长总课时。更值得练的题获得更大权重,贡献为负的题则在后处理时把权重截为零;与此同时,模型每一步调整的总体力度尽量不变。论文用一个与小批次规模相关的 Gram matrix(记录各样本梯度之间关系的矩阵)求解权重,并把这一过程嵌入 PPO、GRPO 等策略梯度式 RFT 的优化循环。
因此,“主动挑题”是方便理解的标题,机制本身其实更克制:DIEM 没有换掉题库,而是在每个训练批次里动态调音量。
数字说明了什么
语言模型实验使用开源 Qwen 系列模型、14,973 道数学训练题和 16 张 NVIDIA H200 GPU。与标准 GRPO 相比,DIEM 在五项数学评测的平均分上,对四种模型分别提高 1.74、2.50、3.36 和 1.68 分。Qwen3-4B 的平均分从 37.30 升至 40.66,是其中最大的一组平均增幅。不过它并非每项都赢:同一模型在 AMC-23 上由 GRPO 的 58.5 降到 55.0。
多模态实验更能检验它是否只适用于文字数学题。Qwen2.5-VL-7B 在六项评测上的平均分为 61.8,高于 Vanilla RFT 的 59.1,也高于当组最佳既有数据选择方法 SPEED-RL 的 60.0。32B 版本则取得 67.3,Vanilla RFT 和 SPEED-RL 分别为 64.9、65.6。
消融实验——逐项替换组件以判断谁真正有用——也支持“两步缺一不可”。完整方法得分为 58.0;把动态影响分数换成随机值后降至 53.0,换成 PCL 难度分数后降至 52.1;保留评分但取消重加权,得分为 55.4,改用普通 Softmax 归一化则为 56.4。
真正值得看的,是训练重点会移动
论文按 Pass@k——多次尝试中至少答对一次的比例——把题目粗分为简单、中等和困难,并追踪 DIEM 分配的相对权重。训练早期,简单题和中等题权重较高;随后简单题权重迅速下降,困难题权重总体上升,但伴随波动。
这正是 DIEM 最有意思的地方。课程不再由人预先写成“先易后难”的固定表格,而是从模型每一步的更新方向中长出来。它追问的不是哪类题永远最好,而是模型现在缺什么、什么时候已经练够、何时该把注意力移走。对强化微调而言,数据由此不只是训练前准备好的原料,也开始成为训练过程本身的一部分。
局限与未知
- 目前证据来自作者论文。实验覆盖 Qwen 系列的数学与多模态推理任务,尚不能据此断言它对其他模型和任务普遍有效。
- 论文用批次总奖励与梯度对齐近似单个样本的边际贡献。这是一种局部、逐步判断,是否等同于更长训练后的最终收益,材料没有给出独立验证。
- 论文称代码将发布到
https://github.com/hrtan/DIEM,不能视为已经开源;材料也未确认该地址已有可用实现。