Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.069 — 2026-09-11
PAPER HF 377 约 7 分钟

NeoHorse-1:Agent把自己送回训练场

NeoHorse-1把Agent的使用记录变成训练材料,串起诊断、路由、再训练的改进闭环。

你请一位助理处理旅行改签。第一次,他选错工具,遗漏限制,最后没办成。传统做法通常只记住“失败了”;NeoHorse-1想多走一步:保留他如何判断、调用了什么工具、在哪里卡住,再把这些记录送回训练场。下一轮训练因此不只增加题量,还会专门补系统暴露出的短板。

这项工作的核心,是让Agent——能够规划步骤、调用工具并执行任务的AI系统——从运行过程里生产下一轮学习材料。它瞄准的是递归自我改进(Recursive Self-Improvement,RSI):系统根据自己的使用证据更新下一版,新版本再产生新证据,循环往复。这里的“自我改进”并不是模型凭空改写自己。数据筛选、评估、训练和重新部署仍由明确的工程流程完成。

本文事实与效果数字均来自NeoHorse-1论文,尚无第二个独立信源复核。作者也把它称为“初步原型”,而不是已经能够持续自我升级的成熟系统。

路由器不只派活,也负责体检

NeoHorse-1是一组面向Agent的模型,围绕一个带模型路由的harness运行。Harness可以理解为Agent的工作台:它管理上下文、工具以及模型与外部环境的交互。模型路由则像客服分诊,根据请求和当前状态,把任务交给不同能力层级的模型。

系统设置了C0至C3四档服务。C0处理边界清楚、风险较低的请求;C1是通用默认档;C2面向多步推理和执行;C3追求最高能力或可靠性。每个用户回合都会留下三类信息:路由器预测需要什么能力,系统最终选择并实际调用了哪一档,以及后续任务做得怎样。

关键之处在于,作者没有直接把“实际调用了强模型”当成任务很难的标签。实际路线还可能受用户选择、服务可用性和部署策略影响。NeoHorse-1重新根据请求及当时可见的交互历史估计能力需求,再用这个信号安排训练顺序。换句话说,路由器既派活,也给训练团队提供一份能力体检记录。

把工作过程做成教材

普通问答数据往往只有问题和答案。Agent后训练需要保留更多现场信息:模型怎样推理、调用了什么工具、工具返回什么结果、是否改正错误,以及任务最后有没有完成。

NeoHorse-1先把完整交互轨迹拆成用户回合,同时保留当前回合中交错出现的推理、工具调用、观察结果和可见回答。较早回合的可见消息与工具结果继续作为背景,但早先的内部推理会被省略。这样,模型学习的不是一个脱离环境的答案,而是一条“判断—行动—反馈—继续判断”的链条。

这些记录不能直接照单全收。系统先做结构检查,例如工具调用与返回结果能否对应、事件顺序是否合理、回答是否缺失。完整记录继续处理;部分可恢复的记录只保留因果关系闭合的片段;归属含混或没有可用训练目标的记录则被隔离。

随后,系统从六个维度评价内容:目标是否达成、是否遵守指令、工具使用是否合适、结论是否符合现有证据、出错后能否恢复,以及是否正确结束。每项分别标为PASS、WARN、FAIL或NOT_EVALUATED,而不是压成一个看似精确的总分。材料还按Scene、Goal和Outcome标注,即用户在做什么、想达到什么标准、最终取得了什么可验证结果。

先学常规题,再碰硬任务

路由信号接着进入三阶段监督微调课程。监督微调(SFT)就是让模型模仿经过筛选的示范。课程学习则类似分阶段授课:逐步加入能力需求更高的样本,同时在后期保留部分较容易的任务,避免训练尾声只剩难题。每个样本在一次训练过程中使用一次,阶段切换时不重置优化器或学习率进程。

但模仿历史答案还有一个问题:真实运行时,模型面对的是自己刚刚生成的内容,而不是教师留下的完美前文。为缩小这道差距,作者加入routing-guided on-policy distillation。On-policy distillation可译作“同策略蒸馏”:学生模型先沿着自己的回答继续生成,固定的教师模型再对学生实际走到的每一步提供下一个词的概率监督。路由信号仍负责从较低到较高能力需求安排起始场景,教师则跟着学生当前的行为纠偏。

真正的闭环在下一批数据

NeoHorse-1最后把评测反馈汇成“能力缺口画像”:哪些任务、服务层级、质量维度和结果状态表现较差。下一轮训练会提高这些薄弱区域的数据占比,同时保留广泛覆盖。成功轨迹提供正向示范;失败轨迹主要用于指出哪里需要补数据或重新配比,而不是直接作为一种独立的失败训练目标。

于是流程串了起来:harness产生交互记录,系统筛选和标注记录,路由信号安排学习次序,评测决定下一轮数据配方,更新后的模型再回到harness接受新任务。这就是论文所说的evaluation–selection–update闭环。它比泛泛地说“让AI改进AI”具体得多,因为诊断证据、训练材料和更新入口都能在系统里找到对应位置。

数字说明了什么

论文在10个基准上评估Agent执行、工具使用、代码生成和指令遵循。4B模型后训练前的宏平均分为58.94,训练后升至64.87,增加5.93分;9B模型从65.60升至69.04,增加3.44分。宏平均是先分别计算各项成绩,再给不同基准相同权重求平均。

一个更直观的比较是模型大小。训练前,4B与9B基座模型相差6.66分;训练后的4B达到64.87,与9B基座的65.60只差0.73分。论文称这显著缩小了总体差距,这个方向与数字相符,但4B并未真正超过9B基座。

作者报告,提升主要集中在依赖harness和执行过程的任务。4B模型在双方都有成绩的项目上均超过同规模的Qwen3.5-4B;9B版本在多数项目上超过Qwen3.5-9B,但有一项指令遵循指标小幅下降。这也提醒我们:总平均上涨,不代表每项能力都同步改善。

为什么现在值得看

NeoHorse-1最有意思的地方不是又做出一个更高分的Agent,而是把部署系统中原本用于节省成本、分派模型的路由记录,改造成训练反馈。系统不只知道答案对不对,还试图知道任务要求何种能力、用了哪类资源、过程哪里失手,以及下一批训练材料应该向哪里倾斜。

这为递归自我改进补上了一条可操作的链路。不过,目前证据只能说明一次后训练带来了提升,不能证明多轮循环会持续变强。它更像一座已经接通各段管线的试验装置,而不是一台可以自行长期运转的增长机器。

局限与未知

  • 论文展示了闭环设计和一次后训练结果,但没有给出多轮迭代后能力持续增长的证据,因此不能说NeoHorse-1已经实现了可持续RSI。
  • 宏平均可能掩盖单项退化。论文部分Agent基准做了三次独立运行,另一些只运行一次;材料没有给出方差、统计显著性和完整的成本比较。
  • 教师模型身份、推理成本,以及路由系统本身对总增益的独立贡献没有交代清楚。论文称训练候选会与评测集进行精确和近重复筛查,但仅凭现有材料仍无法把全部提升归因于模型参数层面的“自我改进”。

供稿材料 SOURCES — 1

← 返回 2026-09-11 · 学术板块