玩一个没有说明书的新游戏时,AI也会边试边猜。问题是,最终通关并不能说明它真的摸清了规则,也可能只是碰巧走对。Kepler面向交互式推理评测ARC-AGI-3——Agent需要通过行动探索陌生环境——把每次猜想写成可执行的“世界模型”:输入当前状态和动作,程序就预测下一步会发生什么。
它最关键的一步,是让猜想接受复查。系统会拿新规则回放全部历史记录;执行新动作前,也会先预测结果。如果现实与预测不符,剩余计划就会终止,并留下反例。这样,评测者看到的不只是分数,还能追查Agent当时相信什么、哪里判断错了。
作者报告称,在固定的Claude Opus 5配置下,Kepler在25个公开游戏上取得服务器验证的100.00 RHAE。不过论文也主动收窄结论:这些是公开游戏开发后的最终回放,不代表首次接触陌生任务时的能力;而且预测为空或报错时,动作仍可能继续,因此“可审计”不等于每一步都已验证。