你让 AI 修改一个大型软件项目:它得先找到相关文件,读懂彼此关系,调用工具检查结果,再根据报错继续修改。真正困难的不是答对一个问题,而是在漫长流程里持续做对下一步。StepFun(阶跃星辰)推出的 Step 5 Preview,瞄准的正是这类工作。
它被 StepFun 称为面向 Agentic work 的旗舰模型。Agentic work 可以理解为“让 AI 接手一段流程”:模型不只给出一次回答,还要规划步骤、调用工具、检查结果并反复修正。StepFun 给出的主要卖点是,模型能处理横跨大型代码库和长文档的扩展任务。
不过,目前公开材料只有 StepFun 在 OpenRouter 页面上的介绍,没有论文、官方技术报告、代码仓库或第三方评测。下面提到的能力和表现,主要应看作厂商声明,而非已经独立验证的结论。
600B,不等于每一步都跑600B
Step 5 Preview 最醒目的数字是 600B,也就是 6000 亿总参数。但它采用稀疏 Mixture-of-Experts(MoE,混合专家)架构:模型内部有许多“专家”子网络,每次处理一个 token——也就是模型读写文字时使用的基本单位——只调用其中一部分。
因此,它的总参数是 600B,每次实际激活的参数则是 27B。可以把它想成一家拥有很多专科团队的大型事务所:全部员工代表总容量,接到具体任务时,只有相关团队参与。这样既能扩大模型储备的能力,又不必让每次计算都动用全部参数。
27B 激活参数更接近模型单步生成时的计算规模,但不能简单等同于完整成本。更多权重仍然需要被存放或调度。换句话说,稀疏架构降低的是“每一步叫多少专家来干活”,并没有让那座拥有 600B 参数的模型凭空消失。
它押注的是长流程,不是一次问答
StepFun 将 Step 5 Preview 定位为旗舰模型——通常指厂商能力覆盖最广、面向高要求任务的一档。它没有把重点放在聊天,而是放在软件工程和专业知识工作上。
这一区别很重要。普通问答像请人回答一道题;Agent 任务更像请人完成一份项目。模型需要跨越许多文件或文档,使用外部工具,并在多轮执行中继续改进结果。任何一步理解错误,都可能在后续不断放大。
据 StepFun 在 OpenRouter 页面上的描述,Step 5 Preview 在软件工程和专业知识工作中“表现强劲”,尤其擅长金融任务。但页面没有给出基准名称、得分、对照模型或测试方法。因此,我们只能确认这是它主攻的方向,暂时不能确认它在这些任务上究竟领先多少。
为什么这次押注值得看
Step 5 Preview 展示了一条清晰路线:用很大的总参数容量承载更多能力,同时用较小的激活参数控制每一步的计算量,再把这些能力投向代码库、长文档和工具调用等长流程任务。
这也延续了阶跃星辰对“大模型能力继续向上走”的判断。据 36氪《智能涌现》报道,创始人姜大昕曾在微软工作16年并做到全球副总裁;ChatGPT 对“你几岁、明年几岁”这一组连续问题的回答,促使他重新审视大模型,并在2023年春节前后开始组建团队。Step 5 的看点,已经不再是模型能否接住一句追问,而是它能否在更长、更复杂的专业任务里把事情做完。
OpenRouter 页面还列出,其最佳供应商的 P50——即一半请求快于此值、一半慢于此值——首次响应延迟为 3.48 秒,生成速度为每秒 64 token。这是平台在特定供应商、负载和请求配置下的观测值,不是模型固定不变的速度。
局限与未知
- 目前没有第三方实测,工具调用、多步骤改进和跨大型代码库等能力仍是产品描述。
- 页面虽列出 1.00、2.70 和 0.05 美元三个价格数字,却没有保留对应计费项目和单位,不能据此计算实际使用成本。
- 材料没有说明模型的开放方式、部署条件、上下文长度,也没有披露软件工程或金融任务的具体评测成绩。