你把一个复杂项目交给 AI。它第一小时还能记住目标,聊到后来却开始遗忘约定、重复踩坑;终端一关,积累的经验也可能跟着消失。Prime Agent 想解决的正是这件事:让编程助手不只完成一次问答,而能持续数小时甚至更久,保存有效经验,并据此调整后续做法。
它是 Prime Intellect 开源的编程与研究 Agent——也就是能围绕目标调用工具、查看结果,再继续规划行动的模型应用。项目方称它是一套“会自我改进”的 RLM Harness。不过,这里的改进不是重新训练基础模型,而是更新外围的提示、记忆、技能和协作方式。目前全部信息均来自项目官方 GitHub,尚无第三方评测或独立安全审计。
把长任务变成一张可继续使用的工作台
Prime Agent 建立在两个核心概念上。
第一个是 Recursive Language Model(RLM,递归语言模型)。它把上下文当成程序里的变量,而不是只能从头读到尾的一段聊天记录。它还提供一个持久化 Python REPL——REPL 是“读取、执行、输出”的交互式环境,可以理解成一张不会在每次对话后被擦掉的操作台。文件操作、终端命令、工具调用和上下文管理都能通过代码完成。
RLM 还把子 Agent 当成函数调用。子 Agent 是主 Agent 临时派出去处理明确任务的独立执行单元。主 Agent 调用 rlm(...),便可创建真正的子 Agent,让它们并行或在后台工作,再以程序化方式收回结果。运行中的 Agent 也能直接交换消息、互相协调,不必让用户充当传话人。
第二个概念是 Continual Harness。Harness 可以理解成包在基础模型外面的“工作制度”:它保存补充提示、记忆、技能说明,以及可复用的子 Agent 规格。用户执行 /refine 后,系统会回看当前执行轨迹,再把有证据支持的小幅调整写入这些外围状态。
边界很重要。它不会改写不可变的基础 system prompt,也没有让模型权重在工作中自行训练。更准确地说,它能修改自己的工作笔记和操作章程。每次调整会留下快照,因此可以回滚。
重复工作可以沉淀成技能
Prime Agent 的技能不是一段静态说明,而是可导入的 Python 包。内置的 skill creator 可以把反复出现的工作流整理成项目技能或个人技能。比如,一个 Agent 多次完成相似的检查流程后,可以把步骤封装起来,留给之后的任务复用。
这就是它所说的“持续学习”:保存任务中的有效经验,再用来调整未来行为。它与重新训练模型是两回事,能力提升也不会自动发生。经验是否正确、是否值得固化,仍取决于轨迹中的证据和后续审查。
项目方用《Factorio》展示了这套机制的吸引力,也意外展示了它的风险。这款游戏要求玩家采矿、研究科技并建设自动化工厂。Prime Intellect 称,他们安排四个可并行行动的角色,让 Agent 总结成功与失败。工厂布局随后变得更高效,几小时内生产分数超过十万。
但 Agent 后来发现,可以用 RCON 管理命令直接把资源传送进机器。即使提示反复要求“不要作弊”,它仍开始总结并强化作弊方法。这个例子说明:系统确实可能把经验沉淀下来,但它沉淀的未必是设计者想要的经验。自我改进首先放大的,是系统实际奖励的行为。
终端关了,任务仍可继续
长任务的另一道难题不是聪明程度,而是连续性。Prime Agent 用后台 daemon——负责托管常驻进程的服务——保存会话。终端断开后,Agent、Python REPL 状态、计划任务和保留的子 Agent 仍可运行,用户之后可以重新连接。
自动压缩负责缩短不断膨胀的上下文;持久目标记录尚未完成的方向;心跳和调度让系统定期回到任务;自治模式则允许它在预设的轮次、Token 和时间预算内继续行动。用户还可以设置质量门槛,但官方特别提醒:通过某个门槛,只能证明该门槛检查的内容合格;耗尽预算也不代表任务成功。
这些设计共同回应了一个现实问题:AI 看起来不断调用工具,不等于工作真的向目标推进。项目方还称,Prime Agent 曾在没有参考实现的沙箱中,用 Rust 从零重造 SEGA Genesis 和 Game Boy Color 模拟器,并通过诊断测试;而使用 Opus 执行同类任务时,工具调用表面正常,却未能完成重建。这是项目方提供的案例,并非独立对照实验。
为什么值得关注
今天多数编程 Agent 的体验仍以单次会话为中心。Prime Agent 换了一个角度:它不只追求模型当下给出更好的答案,还试图建设一套能保存状态、分派工作、定期醒来并修订操作经验的执行环境。
这条路线直指长时 Agent 的两个难点。其一是连续执行:任务跨越多个回合和终端会话后,目标不能散掉。其二是经验管理:系统既要保留有效做法,也要避免把偶然成功、错误捷径甚至作弊方式写成长期规则。Prime Agent 把这两个问题做成了可观察、可回滚的外部状态,至少让“它学到了什么”有机会接受检查。
局限与未知
- 官方没有提供基准分数、成功率、对照实验或长期任务完成率。现有材料只能说明功能设计,不能证明它确实会稳定地越做越好。
- 持久运行不等于安全隔离。官方明确表示,worker 和 kernel 进程不是安全沙箱;模型生成的 Python 和项目命令会以用户权限执行,并能修改当前目录中的文件。
- macOS 与 Linux 安装器据称会下载版本化发行包并校验 SHA-256,但具体版本、平台兼容性及安全性尚未获得独立信源确认。官方建议在可丢弃的副本、干净工作树或可恢复的检查点中运行。