Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.096 — 2026-10-08
PAPER H 1 约 1 分钟

Agent强化学习开始细算每一步功劳

AdaStep会判断每一步反馈是否可信,再决定它该在多大程度上影响训练。

像复盘一趟多次搜索、比较再提交的订票过程,如果最后只知道“成功”或“失败”,就很难判断哪一步做对了。Agent强化学习也有这个麻烦:AI完成一串操作后才收到总分,沿途的好动作可能因最终失败而受罚,坏动作也可能搭着成功结果被奖励。

AdaStep的做法,是给每组局部评价自适应调节权重。这里的“信用分配”,就是把最终成绩分摊给沿途决策;局部结果若主要随所选动作变化,就多保留它的信号,若差异更多来自后续动作或环境随机性,就把它压低。作者将这一权重写成一个均方误差估计问题,并直接利用已有训练轨迹计算,不需要额外的评价模型、采样或模型推理。据论文自述,AdaStep在三个模型和ALFWorld、WebShop、ScienceWorld三项任务上均优于对照方法,相比GiGPO最高提升9.36分,而信用计算时间只增加约1%。


供稿材料 SOURCES — 1

← 返回 2026-10-08 · 学术板块