Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.062 — 2026-09-04
PAPER HF 5 约 1 分钟

网页本身也能充当世界模型

WebWorld让真实浏览器充当裁判,只把经点击验证且不破坏旧功能的网页修改用于训练。

让 AI 改网页,难点不只是把页面做得好看。按钮可能点不动,表单可能无法提交;修好一处,还可能弄坏原本正常的功能。如果仍让同一个模型看截图、提修改、再给自己打分,它很容易把“看起来对”当成“真的能用”。WebWorld 的做法,是把真实浏览器变成外部裁判。

具体来说,VLM——能同时理解图片和文字的视觉语言模型——先根据截图和运行记录提出问题。系统再把建议写成可检查的“交互合约”:要完成什么操作、浏览器如何点击验证,以及哪些已有功能必须保留。候选代码只有在浏览器重新执行后既取得目标进展,又没有破坏此前验证过的能力,才会获得“验收证书”,进入下一轮和训练数据。

最能说明作用的是对照实验:论文作者称,在同为 9B 参数规模的设置下,去掉浏览器证书后,HTMLBench 相对原始模型只提高 0.4 分;完整 WebWorld 的提升超过其十倍。换句话说,关键不只是让 AI 多反思几轮,而是让网页用真实运行结果回答:这次修改到底有没有用。


供稿材料 SOURCES — 1

← 返回 2026-09-04 · 学术板块