你拿到一个“读过很多书”的基础模型,离真正好用还差多远?它可能会续写文字,却不一定能按格式回答、稳定推理、写出可运行的代码,更别说连续使用工具完成任务。把这些能力补齐,靠的是后训练(Post-training)——类似通识教育之后的职业训练。问题在于,很多团队只公布最终模型,很少把完整训练过程讲清楚。
Rufus-Air想补上这块缺口。论文从公开基础模型GLM-4.5-Air-Base出发,给出一条串行的八阶段流水线,并记录数据、奖励设计、基础设施、阶段顺序和逐阶段结果。它不是发明某一种新算法,而是展示一套百亿级Mixture-of-Experts(MoE,混合专家)模型如何被逐步打磨。该模型共有106B参数,每次计算激活其中12B。
需要先说明:本文全部效果数据来自Rufus-Air论文,尚无独立复现。作者所称“开放、可复现”,也不自动等于所有数据、代码、权重和基础设施已经完整发布。
八段训练,像一门逐级加难的课程
流水线依次是:SFT、Reasoning RL、Coding RL、Instruction-Following RL、General Agent、Coding Agent、Search Agent,最后是RLHF。
第一步SFT(监督微调)最像看范例学习:模型读取“输入—理想回答”,模仿正确的推理、对话和工具调用方式。接下来几步采用RL(强化学习):模型先尝试回答,再根据得分调整行为。数学题能核对答案,代码能实际运行,因此奖励比较明确;开放式表达没有唯一正确答案,评分更容易含糊。
这也解释了阶段顺序。作者先安排推理和代码训练,因为答案匹配、单元测试等“硬奖励”较难钻空子;再训练复杂指令和工具使用;最后才用RLHF——把人类偏好转化成训练信号——处理有用性、表达质量等难以用标准答案判断的目标。说白了,越容易可靠判分的课越早上,越依赖裁判判断的课越晚安排,以减少模型长期迎合评分漏洞的机会。
不过,顺序并非机械地按奖励软硬排列。Instruction-Following RL已经使用LLM裁判,但作者认为指令遵循接近模型原有行为,留下的投机空间较小,所以把它放在三个Agent阶段之前。论文也明确承认:后续阶段仍会更新同一批参数,这种排序不能保证早期能力永不退化。
SFT不是热身,而是打地基
论文最值得借鉴的判断之一,是把SFT视为能力建设阶段,而非进入RL前的简单热身。
其SFT混合数据包含约901万条样本、445亿原始token;token可理解为模型处理文字时切分出的基本单位。其中约270亿token真正参与训练损失计算。数据覆盖通用对话、数学、STEM、代码以及两类Agent轨迹。按样本数看,General Agent占39.6%;按训练token看,数学与Coding Agent合计占49.1%。这提醒我们,只看“多少条数据”可能误判训练重点:一道很长的推理题,教学分量远大于一句短对话。
作者使用17个公开数据集,未另行生成Rufus-Air回答,也没有新增人工标注或内部蒸馏教师。不过,一些公开数据本身含有其他模型生成的回答和轨迹,因此“没有内部教师”不等于训练材料完全没有模型生成内容。
数据还经过格式统一、最长120K token过滤和评测污染检查。团队最终从SFT混合数据中移除4,187条样本,但也承认,基于文本重合与向量相似度的筛查无法排除所有泄漏。
SFT在512张H200 GPU上训练三个epoch,也就是把完整数据看三遍。训练损失持续下降,但留出评测在第一遍内便趋于平稳。因此团队没有采用最后一步,而选择平台期中的第3799步检查点进入RL。这是一个很实际的工程信号:继续把教材背熟,不一定继续提高考试能力。
让题目处在“刚好学得会”的区间
Reasoning RL覆盖数学、科学问答和逻辑谜题,共121,161个提示。作者先删除连强教师模型也无法答对的问题,再用当前模型筛掉成功率高于0.8的简单题,以及一次都答不对、暂时学不会的题。训练中还动态保留既非全错、也非几乎全对的题组。
这像给学生布置练习:全会做,没有新信号;一道也做不出,同样很难知道该往哪里改。有效训练发生在两者之间。论文据此把“难度过滤”视为比更换RL目标函数更关键的数据工程。
结果并非所有指标一起上涨。相对SFT检查点,Reasoning RL把GPQA从68.2提高到73.5,但AIME 2025和2026分别下降2.8和2.6分。作者认为后两项变化落在评测噪声范围内,但这仍说明每一阶段都有取舍,不能只看最佳数字。
Coding RL随后用29,405道编程题和真实执行结果评分:程序通过全部抽样测试得1分,否则得0分。训练初期,11%至28%的回答撞上64K token上限,因截断而不能用于学习。团队把上限扩到128K后,截断率降至0.1%,LiveCodeBench v6的pass@1最终从68.6升至75.9。这里最有价值的结论并不玄妙:输出预算和沙箱稳定性会直接决定模型能否获得训练信号。
Instruction-Following RL则训练两类能力:一次满足多个明确约束,以及在多轮对话中记住早先要求。数据包括14K条单轮多约束提示,以及13K段平均6.1轮的对话。每项要求单独检查,只有全部满足才给正奖励。能机械判断的条件交给Python,例如段落数和禁用词;涉及语义的条件交给LLM裁判。该阶段让IFBench从63.8升至77.8,Multi-challenge从31.1升至55.8。
工程配置本身也是配方
论文强调,后训练不是只有数据和算法。长程Agent训练还依赖一致的对话模板、能稳定运行工具的沙箱、支持多轮交互的输入输出记录,以及大批量RL和Rollout Routing Replay。推理时使用FP8,训练时使用BF16,也需要校正两者带来的偏差。
最终模型在论文列出的多数指标上超过官方GLM-4.5-Air版本。例如IFBench为76.9对33.6,LiveCodeBench v6为76.4对59.6,SWE-bench Verified为65.6对50.6,BrowseComp为37.1对22.7。但它并非全面领先:Arena-Hard v2 Creative Writing为53.0,低于官方版本的60.3;与同规模开放模型比较时,也有若干项目落后。更稳妥的解读是:这套配方在投入训练信号最多的指令遵循和Agent能力上提升明显,而不是证明它普遍优于所有对手。
局限与未知
- 所有结论来自同一篇论文,部分工程判断源于训练经验,而非完整消融实验。
- “可复现”目前是作者主张;公开说明配方,不等于第三方已经能以相同资源复现全部结果。
- 八阶段共享参数,后续训练可能损伤早期能力;现有逐阶段评测能显示变化,却不能证明该顺序是唯一或最优选择。