你给一个学生划好重点、列出矛盾,再让他猜出课本结论。即使答对,也很难判断他是在推理,还是见过相似答案。AI“发现新科学”的争议也是如此。独立研究者 Michael Hla 在2026年3月启动 Machina Mirabilis 项目,试着把一个模型送回1900年的知识环境,看它能否抢在历史之前提出光量子和相对论。Nature相关文章梳理了这类“爱因斯坦测试”;目前材料来自量子位对该文及项目的二手转述,并非对一篇Nature研究论文的精读。
先把答案锁在门外
所谓“爱因斯坦测试”,就是只给模型某个历史节点以前的知识,让它独立提出后来才出现的理论。它想排除一种常见假象:模型看似完成了推理,其实只是从训练数据里找回答案。
Hla从零训练了GPT-1900。它是一个33亿参数的Transformer——一种从大量文本中学习语言规律的模型,基于Andrej Karpathy的nanochat框架搭建。量子位援引项目资料称,其主要预训练材料是1900年以前的书籍和报纸,共约220亿token;token是模型切分文本后的基本单位。项目还收集了2600多部历史物理书籍、期刊和科学著作,形成约2.9亿token的专门语料。
清洗也很严格。含有“爱因斯坦”“量子力学”“相对论”等现代概念的整份文献会被删除,现代前言、脚注和明显晚于1900年的词汇也要过滤。麻烦在于,数字化古籍的一句后加注释或一个OCR识别错误,都可能把未来偷偷带回过去。因此,这个“1900年”只能尽量逼近,无法证明绝对纯净。
它看见了光量子的影子
测试中,人类先整理了一道光电效应问题:为什么光的频率不够高时,再亮也打不出电子;超过门槛后,亮度主要影响电子数量,频率则影响电子动能?研究者还列出关键实验线索和当时流行的经典假设。
GPT-1900在一次回答中提出,光也许并不连续,而是由彼此分离、频率不同的部分组成。这让人联想到光量子:光以一份份能量传递,每份能量为,与频率有关。
但这只能算一次“直觉闪现”,不能写成模型重新发现了光量子。按照量子位的转述,GPT-1900在大多数物理任务上失败,也没能可靠地重新发现光量子、狭义相对论或广义相对论。更关键的是,人类已经替它挑出现象、整理矛盾并提供线索。模型面对的更像一道精心编排的难题,而不是开放的科学世界。
真正难的不是说出一句新话
实验还有一道更大的裂缝。项目使用Claude Sonnet 4、Claude 3 Haiku等现代模型生成指令问答,强化学习——通过评分信号调整模型行为的训练方式——也依赖现代模型评分。即使显式的现代知识经过过滤,研究者仍无法排除语义层面的知识泄漏。因此,那次亮眼回答究竟来自推理、文本拼接,还是既有理论的隐性召回,目前没有定论。
Google DeepMind研究员Tom Zahavy把科学推理分为三类:归纳是从例子总结规律,演绎是从前提推出结论,溯因则是为异常现象发明新的解释框架。据量子位转述,他认为大模型擅长归纳,演绎能力正在提高,但仍缺少这种“溯因飞跃”。
类似问题也出现在Sendhil Mullainathan研究的行星轨道基础模型中:模型能在设定任务里预测,却不能在新场景中稳定迁移牛顿力学。MIT计算机科学家Jacob Andreas进一步指出,生成一段类似相对论的表述未必最难;更难的是判断哪个理论正确、哪个值得投入实验检验。
这正是这项尝试值得看的地方。它没有证明AI能抢先成为爱因斯坦,反而把检验标准抬高了:科学发现不只是给出正确句子,还包括自己找到问题、提出解释、挑出值得验证的方向,并在失败后修正。
局限与未知
- 当前供稿只有一个报道来源,Nature文章、项目日志及相关研究者观点均未获得独立材料交叉核验。
- 现代模型参与数据生成和评分,训练材料也无法证明零污染,因此不能排除知识泄漏。
- 光电效应测试经过人工设计并提供关键线索,尚不能代表模型能够自主完成开放式科学发现。