Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.086 — 2026-09-28
PAPER H 14 约 7 分钟

零数据预训练:模型与自己对弈

两个模型从零开始互相出题,用算力搜索可迁移的规律,而不是消耗更多人类语料。

你请了一位家教,却不给教材。家教先编题,学生做题;题目太简单就换难一点,纯粹乱写、学生无从学习也不行。两者反复磨合,竟可能练出复制、排序、计算等通用能力。论文《Self-Play Pretraining with Zero Data》尝试把这套循环用于模型的预训练——模型形成基础能力的第一阶段。

这项工作的看点,不是证明 AI 已经可以扔掉人类语料,而是提出一个更基础的问题:训练材料能否不再由人预先整理,而由学习系统根据自身进度持续制造?如果答案最终是肯定的,基础模型扩展的一部分约束,可能从“还有多少数据”转向“能否设计出可持续的学习循环”。不过,本文仍是作者所称的初步概念验证,以下效果均来自该论文,尚无独立复现。

“零数据”并非没有数据

这里的 Zero Data,准确说是不使用自然数据或人工整理的训练集。模型仍会消费大量合成数据——由程序或模型生成、并非直接采集自现实世界的数据。

系统包含两个从随机状态开始训练、结构相同但参数独立的 Transformer。Generator(出题者)编写小程序;程序交给一台通用图灵机执行,产生原始 byte sequences,也就是字节序列。Learner(学习者)只看这些输出,练习预测下一个字节。它并不是“一个模型跟自己聊天”,而是两个模型同步成长。

作者选择通用图灵机,是为了给出一个尽量宽的出题空间。原则上,任何可计算的数据生成过程,都能写成程序。这里使用一种类似 Brainf*ck 的图灵完备语言,指令可以操作字节、循环、读取和输出。随机输入带让同一个程序也能产生一组不同序列。执行规则还保证每个生成的字符串都能运行,并在限定长度内给出输出。

这套设计没有为语言、图像或音乐分别编写生成器。Learner 使用 256 个字节作为词表,以统一方式处理文本、图片、声音等不同材料。代价也很直观:可搜索的程序空间极大,绝大多数程序未必能提供有用练习。

出题的关键,不是越难越好

Learner 的训练很常规:使用 cross-entropy(交叉熵,用来衡量预测与正确答案相差多远)做下一个字节预测。真正困难的是 Generator 应该得到什么奖励。

一种自然想法是奖励“让学生最难预测的题”。但作者指出,这很容易走偏:只要向序列中塞进随机字节,题目就会变难,却不会教会模型可复用的规律。

论文转而奖励 learning progress,也就是“这道题能否沿着学习者近期真正学会的方向,再推它一步”。技术上,作者比较某个程序产生的训练梯度,与 Learner 在一段回看窗口内的参数移动方向是否一致。已经完全掌握的题,几乎不再产生梯度;毫无规律、无法学习的题,其梯度也不贴合近期进步方向。两者奖励都低。最受欢迎的是那些尚未掌握、但又接得上当前能力的题。

这就形成 adaptive curriculum——会随学生水平变化的自适应课程。Generator 通过 reinforcement learning(强化学习,即根据奖励调整出题策略)更新。每轮候选程序既有新生成的,也有高奖励程序的局部变体,还有旧题回放。系统还把高奖励程序重新教给 Generator,以减轻“学会新题、忘了旧题”的问题。

换句话说,通用图灵机只提供了一座巨大题库的所有可能位置;自博弈负责决定有限算力该花在哪里。论文的对照实验也支持这一点:从同一个程序空间按固定先验抽样,性能提升明显更慢。仅仅拥有“所有可计算结构”的搜索空间,并不等于能有效找到教材。

它学到了什么?

作者让模型在完全没见过评测数据的情况下,预测自然语言、图像、语音、旋律、DNA 和数学序列。所谓 zero-shot(零样本),就是评测前不再用目标数据训练。随着自博弈计算量增加,多类数据上的预测损失呈现可拟合的幂律下降:投入更多计算,损失以相对稳定的规律降低。作者称其缩放指数与直接使用相应自然数据训练时可比,但没有据此声称绝对性能达到常规预训练模型。

自适应出题还找到了可辨认的算术、Fibonacci、几何、二次和三次数列。固定通用先验抽到的程序中,作者除算术数列外没有发现其他这些类别。这说明系统至少能比盲目抽样更早找到结构化练习,但并不能证明这些数列就是跨领域迁移的直接原因。

另一个结果是 in-context learning(上下文学习):模型不更新参数,只从提示里的几个例子临时推断规则。得到足够示例后,它在字符串反转、栈操作和关联回忆任务上接近 100% 准确率,也能在上下文中学习最大值、最小值与求和。以求和任务为例,模型起初输出常见字节,随后尝试复制;大约看过 4 个例子后开始正确处理低 4 位,到 8 个例子时开始处理高 4 位。固定程序先验和 PCFG——一种人工设计、擅长生成层级语言结构的概率语法——训练出的模型,未能学会全部这些任务。

不过,PCFG 在文本和代码上更强;自博弈则在图像、音乐、音频和语音上占优。这个对照说明,专门设计的教材在匹配领域内仍有优势,而较通用的搜索可能换来更宽的迁移范围。

真正值得关注的是学习循环

论文区分了两类信息。一类是可跨领域复用的结构,例如复制、递归和层级组合;另一类是特定世界的事实。自博弈可能自行制造前者,却无法凭空知道后者。现实中的人物、事件和规则,最终仍须通过与现实交互进入模型。

因此,这项工作更像是在分离“从经验里学规律”和“从世界里获事实”。它没有证明自然数据可以被替代,却给出证据:即使训练材料表面上不像自然语言,模型仍可能从中学到对自然数据预测有帮助的结构。若这种循环能扩展,它更可能成为常规预训练的补充,在高质量自然数据昂贵、重复或接近耗尽时继续提供练习。

局限与未知

  • 实验模型小于 2500 万参数,上下文长度为 4096。缩放实验的最大训练预算固定为 343.6 亿 token;结果能否延续到更大模型,论文没有回答。
  • 自然数据虽未用于梯度更新,却用于超参数选择:作者用 DCLM 与 DNA 的平均验证损失挑选学习率、批量大小等设置。这构成有限的信息泄漏,因此“完全不接触自然数据”并不准确。
  • 论文展示的是预测损失随算力下降和若干受控任务能力,不是开放式语言能力。作者也明确表示,通用预训练不能恢复特定世界的事实,并将这项工作定位为概念验证。

供稿材料 SOURCES — 1
01
Self-Play Pretraining with Zero Data arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-09-28 · 学术板块