Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.098 — 2026-10-10
NEWS 约 1 分钟

Seahaven把Agent优化变成RL环境

Seahaven把Agent改造放进可重置、可评分的模拟世界,方便反复比较优化。

IMAGE — r/LocalLLaMA 日榜

你让 AI 连续处理几十步任务,就像让新员工整理公司账目:只看它一路说了什么,很难判断活儿是否真的干对;直接拿生产系统练手,又会留下脏数据。Seahaven 想解决的正是这个问题。它为每次 Agent 运行创建一个独立、可重置的模拟世界,再按 Agent 最终改动的结果评分。这样,提示词、工具、技能和子 Agent 的不同组合,就能从同一起点反复比较。

据作者在 Reddit 的介绍,Seahaven 会为每个实例复制一份 SQLite 数据库,记录每一行数据的变化,并支持并行运行。其示例“Stripe World”模拟支付服务 Stripe,包含 24 张表和 155 个 API 操作;作者称,它兼容 Stripe 的 MCP 工具接口和 REST API,官方 Stripe SDK 无须修改即可连接。这里的 RL,即强化学习,是让系统根据任务得分持续调整策略。

它的价值不在某次漂亮演示,而在提供一块统一实验底座:开发者可以评分 Agent 对世界造成的实际改变,而非翻阅 50 轮对话。不过现有信息主要来自作者自述,尚未给出独立基准或真实系统迁移效果。


供稿材料 SOURCES — 1

← 返回 2026-10-10 · 开源板块