Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.098 — 2026-10-10
PAPER H 5 · HF 165 约 8 分钟

从操作轨迹复刻一个Agent世界

把历史操作记录编成“世界手册”,让AI扮演可交互、能记住后果的训练环境。

从操作轨迹复刻一个 Agent 世界

你让一个 AI 在模拟终端里删除 report.txt。它当下也许只返回一行空白。几轮之后,你再让它读取这个文件,它却若无其事地编出文件内容。问题不在语言是否流畅,而在这个模拟世界没有记住:文件已经被删除。

这正是训练 Agent——能够观察环境、采取行动并接收反馈的智能体——时常见的麻烦。训练需要一个可以反复使用、稳定响应的环境,但真实网站、软件工作区或企业系统可能昂贵、封闭,甚至根本拿不到代码。论文《From Traces to Agentic Worlds》提出 Trace2Env:不重建原系统,而是从历史操作记录中整理出一本“世界手册”,再让一个专门的 AI 充当环境。

这项工作获得了 155 次社区点赞,关注点很实际:当可用环境不足时,我们能否仅凭过去留下的交互流水账,造出一个足以训练和评测 Agent 的替身?以下结果均来自论文作者的实验,尚无独立团队复核。

不复刻机器,先复刻它的行为

交互轨迹(interaction trace)可以理解为系统留下的流水账:当时是什么状态,Agent 做了什么,系统又返回了什么。积累足够多的记录,就可能反推出环境通常怎样响应。

传统做法可以把环境说明、历史对话和当前动作一起塞进提示词,让语言模型直接猜下一条反馈。这类语言世界模型(Language World Model,LWM)不用真正运行原程序,而是用语言生成来扮演环境。它容易搭建,但长时间保持一致很难。历史越长,通用规则、当前事实和往日案例越容易混在一起。

Trace2Env 换了一个角度。它把“模拟环境”本身也当作一项 Agent 任务:task agent 负责行动,另一个 world model agent 负责判断这个世界应当如何回应。后者不直接访问原环境,而是主动查阅由轨迹整理出的资料,再决定返回什么观察结果,以及哪些状态变化必须保留下来。

论文称它是 learning-free,意思是框架不需要训练或更新语言模型参数,并不等于不用模型推理、计算资源或离线整理。

一本世界手册,三种不同的记忆

Trace2Env 首先离线构建 environment worldbook,即“环境世界手册”。它包含四类材料:

  • Schemas:规定环境接受哪些动作,以及模拟器能够记录哪些状态变量,相当于操作接口和登记表。
  • Grounded evidence:保存真实轨迹中的动作、返回结果和示例,避免所有判断都依赖概括出来的规则。
  • Induced abstractions:从多条轨迹归纳重复出现的行为规则、前置条件、输出格式和约束。
  • Provenance:记录每条材料来自哪段轨迹、哪个回合,方便把推断追回原始证据。

构建器会对齐动作与结果,提取可观察事实和可能的状态影响。归因不清的影响会被暂时搁置。它还会比较成功与失败案例:如果一个动作有时成功、有时失败,差异可能暴露某个缺失的前置条件;反例也可能迫使规则缩小适用范围,或者继续保持不确定。

真正运行时,系统还会维护两份只属于当前回合的材料:可变的 episode state,以及 episodic memory。前者记录“现在什么是真的”,后者保留“此前具体发生了什么”。世界手册说明环境通常怎样运转;当前状态说明这个实例眼下处于什么状况;情节记忆则保存事情发生的时间顺序和原始细节。

这种分层很关键。旧轨迹可以告诉模拟器 cat 命令通常怎样显示文件,却不能证明新任务里一定存在同名文件。反过来,新任务中刚创建的文件即使从未出现在历史轨迹里,也必须从此被记住。Trace2Env 还明确把缺失的状态项视为“未知”,而不是武断地当成“不存在”。

每次回答之前,先过一道闸门

面对 task agent 的新动作,world model agent 会从世界手册中寻找相关证据。但“相关”不代表“可以照搬”。一条旧轨迹可能展示了正确的输出格式,其中的文件名、商品或账户状态却只属于另一个任务。

因此,Trace2Env 会判断证据适用于当前实例的程度。有些证据能支持具体行为;有些只能谨慎参考;还有些只能提供回答格式,不能证明当前事实。

world model agent 随后提出两样东西:环境应返回的观察结果,以及需要持久保存的状态变化。它不能直接修改状态。共享运行框架会依据 schema、规则支持和状态约束检查提案,只有通过验证的变化才会提交。下一轮模拟从更新后的状态继续。

说白了,这套设计不是只要求 AI “回答得像”,而是要求它先交代世界发生了什么变化,再由外部机制把变化记到账上。

分数更高,更重要的是不把路带偏

论文在九个环境中测试了 Trace2Env。单步预测覆盖 Terminal、SWE、Android、Web,以及 Food、Shopping、Benefits;多轮测试使用文字交互环境 ALFWorld 和 SciWorld。

单步测试由 gpt-5.2 从格式、事实性、一致性、真实感和整体质量五个维度评分,再换算到 0—100。使用 gpt-5.6-sol 作为世界模型时,Trace2Env 的七个环境平均分为 75.94,直接提示为 69.51,提高 6.43 分。换成 deepseek-v4.1-flash,平均分为 75.75,对应直接提示的 68.71,提高 7.04 分。14 组“环境—模型”组合中,它有 11 组排名最高,没有一组低于直接提示。

消融实验也说明,关键不只是把更多文字塞进提示词。原始轨迹检索、静态加入世界手册、单独使用运行框架都有帮助,但完整 Trace2Env 的平均成绩最高。以 Terminal 为例,世界手册使用 20 条构建轨迹时得分为 64.89;轨迹增加到 36 条后升至 66.42,但一次性的构建成本也随数据量增长。

多轮结果更能说明问题。论文先让 task agent 在模拟环境中行动,再把整串动作放回真实环境执行。直接提示在 ALFWorld 模拟世界中的成功率达到 97%,看起来很好;但这些动作回放到真实环境时,成功率只有 3%。Trace2Env 在模拟世界中的成功率较低,为 88%,真实回放却达到 85%。在 SciWorld 中,两者的真实回放成功率分别为 45% 和 60%。

这揭示了一个容易误判的指标:Agent 在模拟世界里通关,不代表这个世界模拟得准。一个环境可以先编造错误变化,再沿着错误设定自洽地演下去。Trace2Env 有时会拒绝不受支持的动作,导致表面成功率下降,却减少了这种“在虚构状态里获胜”的情况。

为什么值得关注

Agent 环境短缺,不只是数量问题。真实系统还受到费用、权限、安全与可重复性的限制。Trace2Env 展示了一条介于“直接提示模型”和“完整重建软件”之间的路线:保留轨迹证据,归纳行为规范,再用持久状态维持多轮后果。

它最有意思的地方,不是宣称已经复制了真实世界,而是重新界定了复刻目标。模拟器未必需要拥有原系统的全部代码;在部分训练和评测场景里,它可以先努力复现可观察行为,以及行动留下的长期影响。这仍不是完整功能等价,但比逐轮猜一句像样的反馈更接近一个可交互的世界。

局限与未知

  • 模拟能力受轨迹覆盖范围限制。轨迹没有揭示的行为、隐藏状态和边界条件,世界手册无法凭空恢复;论文也承认,不同模型利用重构证据的稳定性并不相同。
  • “原系统不可访问”有明确条件边界。部分实验能够收集独立轨迹或把动作回放到真实环境,另一些则通过基准轨迹的五折交叉构建世界手册,不能笼统理解为任何阶段都完全没有原环境访问。
  • 当前证据来自作者自己的九环境实验。较高的单步评分和真实回放成功率支持“更忠实、更一致”的判断,但尚不能证明 Trace2Env 已成功复刻完整系统,更不能直接证明它可以取代真实环境。

供稿材料 SOURCES — 1

← 返回 2026-10-10 · 学术板块