Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.070 — 2026-09-12
PAPER H 8 约 5 分钟

预训练最优,未必适合微调

一项30B模型研究发现:预训练阶段最亮眼的存档,未必是微调后的最佳起点。

你要从一批实习生里挑人参加专项培训,通常会选入职考试成绩最好的一位。但考试第一,不一定最适合后面的训练。基础模型也可能遇到同样的问题:预训练阶段表现最好的模型存档,经过监督微调后,未必仍然领先。

2026 年 9 月 8 日提交至 arXiv 的论文《Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack》挑战的,正是这一常用选择办法。作者 Sohir Maskey、Philipp Scholl、Jonas Knupp、Pit Neitemeier 和 Sascha Wirges 在一个完整的 30B mixture-of-experts 训练流程中发现,检查点在预训练阶段的优劣排序,可能无法延续到全部下游训练结束之后。

这里的证据目前只来自论文作者,尚无独立复现。公开材料也没有给出实验表格及具体性能差值,因此更适合把它看作一个值得警惕的案例,而不是已经确立的普遍规律。

挑存档,不能只看当时的分数

训练语言模型通常分成多个阶段。第一步是预训练——让模型从海量文本中学习语言规律,常见任务是预测接下来的词。团队不会只在训练结束时保存一次模型,而会沿途定期留下检查点(checkpoint),也就是模型在某一时刻的完整参数存档。

这很像长跑途中不断拍下计时成绩。以后要继续训练时,团队可以从这些存档里挑一个作为起点。

常见挑法是看预训练损失。预训练损失衡量模型预测训练文本时平均错得多不多,通常越低越好。团队也可能查看基准测试分数,再选当时成绩最高的检查点。这里暗含一个假设:现在领先的存档,进入后续训练后仍会领先。

这篇论文报告说,在作者测试的 30B mixture-of-experts 流程里,这个假设失效了。30B 表示模型规模约为 300 亿参数;mixture-of-experts,即“专家混合”,指模型内部包含不同的参数模块,并按输入调用其中一部分。作者比较了不同预训练检查点经过完整下游训练后的表现,发现预训练阶段与下游训练后的优劣排序并不一致。

换句话说,预训练损失较低或基准分数较高,只能说明一个检查点更擅长当时正在考的内容。它不保证这个检查点更容易被改造成后续需要的模型。

微调之后,比赛可能重新排位

后续训练包括监督微调(supervised fine-tuning,SFT):团队拿“输入—理想答案”示例继续训练基础模型,让它学会按照指令回答。论文标题里的“Good Pretraining, Bad SFT”,说的就是一个检查点可能在预训练评估中很好,经过 SFT 等下游训练后却不再占优。

这项工作的关键,不是提出了一种新的微调方法,而是改变评估问题。过去的问题往往是:“这个检查点现在表现多好?”论文提醒团队还要问:“从这个检查点继续训练,最后能走到哪里?”

两者看起来接近,其实衡量的是不同东西。前者评价模型的当前位置,后者评价它作为后续训练起点的潜力。就像挑选待装修的房子,只看交付当天的外观,未必能判断哪套房改造后最合用。

作者还观察到,完成全部下游训练后表现更好的检查点,具有更高的 solution density。这个词可以理解为“好解附近的宽裕程度”:研究者对模型权重做小幅局部扰动后,这些检查点更能保持下游性能。

直观地说,有的好结果像立在针尖上,参数稍微动一点,表现就明显变化;有的则处在较平缓的区域,小幅变化不容易让性能掉下去。论文报告的现象是,最终表现更好的检查点更接近后一种情况。

不过,目前材料只支持两者相关,不能据此断定较高的 solution density 导致了更好的微调结果。它也还不是一个已经得到验证的检查点选择指标。

为什么这件事值得训练团队在意?

如果这一现象在更多模型和训练流程中成立,影响会相当直接。团队不能再默认“预训练阶段分数最高”等于“最值得继续投入”。检查点的保存、评估和淘汰策略,都可能需要覆盖更长的训练链条。

这也暴露出一个现实错位:容易测量的指标,不一定对应真正关心的结果。预训练损失可以在预训练过程中直接获得;完整跑完下游训练,才知道哪个起点最终更好,却需要更多训练工作。论文指出了旧指标可能漏掉的信息,但公开材料还没有说明怎样以较低成本提前识别更好的起点。

因此,这项工作的价值首先是一则方法论提醒:评估基础模型时,不仅要看它现在答得怎样,也要看它经过后续训练后会变成怎样。对需要保存大量检查点、再决定后训练起点的团队来说,这个区别可能影响计算资源最终投向哪里。

局限与未知

  • 现有材料没有披露预训练与下游性能的具体差值、比较了多少个检查点、使用了哪些评测任务,也没有提供随机种子和统计显著性。无法判断排序变化有多大、多稳定。
  • 结论来自一个 30B mixture-of-experts 训练流程和同一篇论文,尚无第三方复现。它说明排序可能失效,不能证明所有模型都会如此。
  • solution density 与最终性能同时出现,不等于前者造成后者。论文摘要也没有说明,它能否在昂贵的下游训练开始前充当可靠的选择标准。

供稿材料 SOURCES — 1

← 返回 2026-09-12 · 学术板块