你让一位新人照着厚厚的工具手册完成实验,他也许知道每个按钮叫什么,却仍会卡在安装顺序、参数配置和报错处理上。研究 Agent 也有类似问题:模型能讲原理,执行框架能安排步骤,但真正把方法跑起来的诀窍,往往散落在 GitHub 仓库的文档、示例、测试和配置文件里。
论文《Repo-To-Skill》提出了一条直接的路线:把完整仓库提炼成紧凑、可调用、经过检查的技能,让 Agent 不必每次从头摸索。作者据此构建了研究 Agent「DisCo」和 AREX-Skill Library。后者从 1,000 个机器学习仓库中产出 5,353 个技能,覆盖 20 个领域和 178 个能力类别。
这值得关注,不是因为“仓库摘要”又做得更短了,而是因为论文试图建立一条 AI 能力供应链:开源社区先积累代码和经验,系统再把它们加工成 Agent 可以重复使用的操作性知识。
Agent 缺的不是知识,而是上手经验
今天的研究 Agent 通常有两部分。第一部分是模型,负责理解、推理、规划和执行;第二部分是 harness——也就是组织任务、保存记忆、调用工具、检查结果并反复修正的一套执行框架。
问题在于,两者都不天然提供领域里的操作性知识。这里说的操作性知识,是“知道怎样把事情做成”:该选哪个工具,数据要摆成什么格式,命令按什么顺序运行,哪些配置看似合理却会让实验失效,以及失败后该从哪里排查。
论文可能告诉你一种方法为什么有效,代码仓库则更像施工现场,保存着 API 用法、配置文件、测试脚本和常见故障。可仓库通常太大,也不是为 Agent 即时阅读而写的。把整个仓库塞进上下文——模型一次能够处理的信息空间——既昂贵,也容易让真正相关的细节淹没在文件海洋里。
我们在 8 月 22 日的报道中比较过技能完整预加载与按需取用:技能太大,同样会挤占上下文。本期工作继续向上游追问:这些紧凑技能最初该怎样从庞大仓库中生产出来?
它不是摘要,而是一张可执行操作卡
Repo-To-Skill 所说的“技能蒸馏”,可以理解为把厚工具手册整理成现场操作卡。重点不是复述仓库“讲了什么”,而是留下 Agent 执行任务时真正需要的步骤、工具和判断条件。
一个 AREX 技能分成三层。SKILL.md 是入口,说明技能解决什么问题、何时使用、怎样操作,以及有哪些已知失败方式;references/ 保存 API 文档、参数配置和算法细节,需要时再打开;scripts/ 提供可以直接调用的执行脚本,避免 Agent 临场重写。
同一仓库常常包含多种能力,因此系统不会硬塞成一个巨型技能,而是做成“技能图”。入口技能负责导航,再指向安装、训练、评估、诊断或修复等组件。Agent 先看路线图,只打开当前任务需要的分支。这种方式叫渐进式披露,也就是先给概要,再按需展开细节。
DisCo 的蒸馏分两种。task-agnostic(任务无关)模式提前处理常用仓库、论文或教程,制作可供许多任务重复使用的技能。task-oriented(任务导向)模式则从一个具体问题出发:先拆解任务,找出 Agent 缺少哪些能力,再搜索资料并现场制作相应技能。前者像预制常用工具箱,后者像根据眼前工程临时配工具。
两种模式都经过四步:确定要覆盖的能力,收集支持这些能力的证据,组装技能,再做验证。这里的验证不是读起来顺畅就算通过,而是尽量运行仓库自带示例、测试、命令行检查、小型样例或冒烟测试。失败会触发局部修复和重新检查,无法解决的问题则保留在构建记录中。论文认为,这一步区分了技能蒸馏与普通摘要。
先生产技能,再让研究 Agent 按需领取
DisCo 同时扮演“技能制作者”和“研究者”。制作模式离线处理知识来源,把通过检查的技能图存入库中;研究模式接到任务后,经由路由器找到相关领域、能力类别和仓库,只载入需要的部分。模型和执行框架不必因此改变,增加的是一层外置的操作上下文。
公开仓库快照包含 1,000 个机器学习项目和 5,353 个技能。作者称,仓库选择参考了开源可见度、实际用途和 GitHub stars,但这是一份策展式快照,并非对整个生态的完整覆盖。构建使用 GPT-5.5 与 GPT-5.6-sol,平均每个仓库分配约 40 美元。最终共有 2,209 条“仓库—领域—能力类别”精确归类记录,700 个仓库进入了不止一个类别。
论文还把同样的方法用于论文和具体评测任务。例如,PaperBench 的技能池从 153 篇相关论文中提炼出 636 个技能,并排除了目标论文及其发布的代码和产物。MLE-bench 则为 75 场竞赛分别制作任务导向的技能图,同时排除原竞赛网页和竞赛专属内容。
固定模型之后,技能能带来多少差别?
作者使用 Codex 作为执行框架,并在有技能和无技能两种条件下固定 GPT-5.5、xhigh 推理强度及下游运行预算。技能在正式执行前构建,其一次性制作成本不计入两组运行预算。因此,这组实验回答的是“提前准备好的操作知识是否有用”,而不是比较两种方案的总成本。
最醒目的结果来自 MLE-bench——一套机器学习竞赛任务评测。加入技能后,Any-Medal 得分从 31.11%升至 72.89%,增加 41.78 个百分点,相对高出 134.3%。在 15 个高难度任务上,分数从 13.33%升至 62.22%。这支持了作者的核心判断:当试错空间更大时,预先整理好的工具选择、工作流程和检查办法可能更有价值。
在考察论文复现的 PaperBench 上,平均分从 29.45%升至 39.59%,增加 10.14 个百分点,相对高出 34.4%。20 项任务中有 18 项提高,但也有两项下降:sample-specific-masks 低了 5.07 分,stay-on-topic 低了 4.52 分。作者认为,一种可能是检索精度不足:不够贴合任务的技能会分散 Agent,反而把它从原本可能找到的解法上带开。
论文摘要还报告,在同类固定设置下,FrontierCS 和 PassNet 的得分分别相对高出 9.2%和 14.0%。这些结果共同指向一个朴素结论:只升级模型和执行框架之外,给 Agent 配好可执行的领域经验,也可能成为独立的性能杠杆。
为什么这条路线值得盯住
Repo-To-Skill 把开源仓库从“供人阅读和调用的代码集合”,重新定义为可加工的 Agent 能力原料。如果这条路线成立,未来竞争的不只是哪个模型更聪明,也包括谁能持续收集、更新、验证并准确路由操作性知识。
它还改变了经验复用的方式。过去,一个 Agent 在任务里踩过的坑,下一次往往还要重踩;技能库则试图把一次制作成本摊到许多后续任务上。说白了,DisCo 想把临场试错变成可积累的基础设施。
不过,“GitHub 仓库正在变成 Agent 技能”目前更适合视为论文展示的一条路线,而不是已经得到行业普遍采用的趋势。
局限与未知
- 目前证据主要来自作者论文这一独立信源,尚缺第三方复现。论文报告的增益不能直接外推到其他模型、执行框架或任务。
- 技能制作成本与运行成本被分开计算。平均每个仓库约 40 美元,但论文现有材料不足以判断整条方案在持续更新、维护和检索中的总体经济性。
- “verified”的标准依赖可用测试和检查;1,000 个仓库的筛选也带有策展判断。材料未充分排除训练数据污染或基准泄漏,技能检索偶尔还会让结果变差。