像下棋前推演一样,Agent会用“世界模型”预演不同动作的后果,再挑一个看起来最好的方案。麻烦是,一旦结果不好,仅看执行轨迹往往分不清:究竟是计划选错了,还是内部模拟器猜错了。论文甚至构造了一个只有两步的例子,证明无论积累多少被动交互记录,这两个原因仍可能无法区分;未知信息可以完全藏在从未尝试的动作里。
Dual-Frontier因此不急着追责,而是先问一个更实用的问题:世界模型推荐的新方案,是否确定比当前方案更好?它设置两道边界:证据不足的候选留在“世界模型边界”,继续验证相关预测;只有当预计收益超过与这次决策相关的模型误差上界,才进入“Agent边界”并被采用。作者给出的理论保证是,被放行的决策不会降低预期回报。关键转变在于,可信度不再是给整个模型贴“准或不准”的标签,而是逐次判断:这份预测证据,够不够支撑眼前这个行动。