Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.080 — 2026-09-22
PAPER HF 60 约 6 分钟

电脑Agent走出单一沙盒

RecreationWorld让电脑Agent在界面、命令行与代码间来回切换,还能用真实运行结果验收。

你让 AI 仿做一个记账应用。它先点开原版,看看按钮、页面和计算结果;再写代码,启动自己的版本;发现图表颜色不对,又回去观察,接着修改。真实数字工作往往就是这样来回穿梭,但现有电脑 Agent 常被分成两类:一类会看屏幕、点鼠标,另一类会写代码、敲命令。RecreationWorld 想把它们放进同一个可验证环境。

这项工作的重点不只是增加工具,而是让 Agent 自己决定何时观察、何时实现、何时运行并检查结果。论文称这种系统为混合电脑使用 Agent(hybrid CUA)——既能操作图形界面(GUI,也就是窗口和按钮),也能使用命令行(CLI)和编程工具。以下结果均来自论文作者自己的实验,尚无独立复现。

把“照着成品重做”变成训练场

RecreationWorld 的任务很直观:给 Agent 一个正在运行的参考应用,让它在看不到完整规格说明的情况下,做出一个行为相近、能够运行的新版本。

这迫使 Agent 形成一个循环:探索参考应用,推测它的功能;编写代码;启动候选版本;观察界面和行为;再回去修改。论文没有规定这些步骤的固定顺序。Agent 可以先多看几页,也可以写到一半再回来检查。这才是“混合工作流”:不是把点击和编程机械地拼成两段,而是让信息在两者之间反复流动。

这个设置还有一个关键好处:原应用可以充当 oracle——也就是提供正确行为的参照物。系统先在原应用上执行操作,记录按钮触发后的文本、状态、计算结果和画面,再把同一套隐藏测试用在 Agent 的作品上。它检查的是实际运行行为,而不是源代码长得像不像。因此,Agent 可以自由选择语言和架构,验收标准仍然相对客观。

框架覆盖 Ubuntu、macOS、Windows、Android 和 Web。严格说,这五项并非同一层级:前三项是桌面操作系统,Android 是移动系统,Web 则是运行形态。它们共同体现的是跨桌面、移动和网页环境的覆盖。RecreationWorld 为这些环境统一提供原生 GUI 控制、编码工具、构建与启动约定,以及实验记录机制。

验收不只看“页面像不像”

配套评测集 RecreationBench 有 250 个留出任务,五个平台各 50 个。测试分为两路。

一路是程序化断言。它通过各平台的自动化接口读取精确文本、控件状态、导航、持久化结果或计算值。另一路是视觉断言,用截图判断布局、颜色、画布内容等结构化接口不容易表达的属性。每个测试都包含触发动作及其结果,不只是盘点页面上有没有某个按钮。

测试也会深入应用内部。按五个平台等权平均,约 77% 的测试会离开起始界面,24.1% 会跨越两个或更多界面;94.2% 检查操作后的结果,40.7% 要求得到精确结果。候选应用若无法构建或启动,得分为零。所有测试在冻结前都要先通过参考应用验证,再由人工复核。

这种设计区分了两个经常被混为一谈的问题:做出一张相似的静态页面,和复现一个真正能工作的应用。前者像搭布景,后者还要让每个开关、计算和状态变化都正确。

现有 Agent 会搭外壳,还不太会复现行为

论文评测了十个前沿模型。材料中名为 GPT-6 Astra 的模型以 58.06% 的总体成绩居首;总体分数综合程序化和视觉两路结果,并对平台等权处理。但它只有 2.8% 的任务通过全部程序化测试。这两个数字口径不同,不能直接相减:前者是分项得分的总体聚合,后者要求一个任务的程序化测试全部通过。

论文还发现,参评 Agent 更擅长复现静态界面结构,不擅长交互行为和计算输出。它们生成的应用通常比参考应用小得多,结构也更单体化。换句话说,模型已经能做出颇像成品的外壳,但隐藏在界面背后的完整行为仍会大量缺失。

任务本身也确实很长。RecreationBench 轨迹的中位数是 282.5 次顶层调用;每 100 次调用中,GUI 与代码编辑之间平均切换 9.08 次。单次轨迹的最长运行时限设为 20 小时。这里衡量的不再是模型能否完成一次点击或补一段函数,而是它能否在长时间里保存线索、反复验证和修正。

为什么值得关注

RecreationWorld 把评测环境同时变成了训练数据生产线。作者让 Qwen3.8-Max 生成重做应用的轨迹,再用行为测试筛选高分样本;五个平台各取 7,000 条,共组成 35,000 条监督微调轨迹。用同一批数据训练的两个模型,在五个分布外基准的最后检查点都高于各自最早检查点,最高增幅为 17.9 个百分点。这些基准覆盖编程、视觉编程和混合电脑操作。

论文也观察到,训练后模型更频繁地查看自己渲染出的结果。这与“先做、再看、再改”的目标一致。不过作者明确指出,这只是初步迁移证据:不同检查点的表现并非一路上升,行为变化也不能证明是分数提升的原因。

真正值得看的,是评测思路的变化。过去可以分别测试 Agent 会不会点击、会不会写代码;RecreationWorld 尝试验收一整段数字工作:它能否从运行中的产品反推需求,完成实现,再用视觉和实际行为检查自己的作品。电脑 Agent 要走出单一沙盒,难点可能不在于再添一种工具,而在于能否持续协调这些工具,并接受可重复的结果验收。

局限与未知

  • 所有效果均由论文作者报告,五个迁移基准没有提供独立复现;最高 17.9 个百分点也不能概括为已经证明普遍泛化。
  • GPT-6 Astra 的来源与具体评测配置在供稿中没有说明,应把它视为论文表格中的模型名称,而不是据此认定某个已公开产品。
  • 作者称已发布 RecreationBench、运行环境和测试套件,但供稿没有项目页、仓库或资产链接,无法据此确认资源目前是否实际可取得并顺利运行。

供稿材料 SOURCES — 1

← 返回 2026-09-22 · 学术板块