Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.067 — 2026-09-09
NEWS 约 1 分钟

手机Agent迎来交互式新考场

MobileWorld把追问用户和调用外部工具纳入手机Agent评测,更贴近日常办事。

IMAGE — r/LocalLLaMA 日榜

你让手机 AI 帮忙发消息,却没告诉它收件人;它是硬着头皮乱点,还是先向你确认?MobileWorld 想测的正是这类真实难题。它是一套 Benchmark——用固定任务和评分规则比较系统——不只考 AI 能否看懂屏幕、点击和输入,还加入了向用户追问信息的任务,以及 MCP(让 AI 统一连接外部工具和数据源的协议)增强环境。

据 Reddit 用户 East-Muffin-6472 对论文的介绍,这套评测包含 201 个任务、约 20 个应用,覆盖通信、消息和生产力等场景。系统只把截图交给负责规划的视觉语言模型,再由另一模型把“点击发送按钮”之类的文字动作换成具体坐标;交互任务中的用户则由 GPT-4 模拟。其整理结果显示,最佳组合 Gemini-3-Pro 与 UI-Inst-7B 的平均成绩约为 52%,模型尤其容易在用户交互和 MCP 任务上失败。数字与结论目前仅来自这篇二手解读,但它点出了一个重要变化:手机 Agent 的考场,正从照着固定脚本点屏幕,转向会追问、会借助工具的协作式办事。


供稿材料 SOURCES — 1

← 返回 2026-09-09 · 开源板块