Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.095 — 2026-10-07
NEWS 约 5 分钟

Beam开源:美国团队亮出501B模型

Beam预告开放501B权重,每次仅激活23B,把高端能力与推理成本摆上同一张桌。

IMAGE — r/LocalLLaMA 日榜

你让 AI 完成一项复杂编程任务,它不只要写代码,还要反复试运行、查看报错,再决定下一步。模型越大,通常越有能力,但每次回答都动用全部参数,成本也会随之升高。Reflection AI 在 10 月 5 日公布的 Beam,试图换一种取舍:模型共有 501B(5010亿)参数,每次只激活 23B(230亿),目标是以较少的推理计算处理编程、推理和 Agent 任务——也就是让 AI 自己拆解步骤、调用工具并根据结果继续行动。

不过,“Beam 开源”目前仍是一张预告。公司称,模型还在进行最终红队测试和评估,目前只开放 early access 登记;权重、技术报告、model card 和开发者材料计划在 10 月稍晚发布。本文涉及的规模与效果数字,也都来自 Reflection AI 单方面披露,尚无独立验证。

501B,不等于每次都用501B

Beam 采用稀疏 MoE(Mixture-of-Experts,混合专家)架构。可以把它理解成一个拥有许多专科成员的团队:总团队很大,但处理一个问题时,只叫来最相关的一部分人。因此,501B 是模型储存的总参数量,23B active 则是一次计算实际启用的参数量。

这也是 Beam 最值得关注的地方。它没有简单地在“模型越大、计算越贵”这条线上继续加码,而是用稀疏激活在容量与成本之间折中。Reflection AI 将它定位为 coding、reasoning 和 agentic workloads,即编程、推理和需要连续操作工具的任务。模型最大上下文长度为 256K tokens;token 是模型处理文字时切分出的基本单位。

公司称,Beam 在预训练阶段使用了 23.8 trillion(23.8万亿)个 token,来源包括网络数据和专有授权数据集。预训练是模型先从大规模材料中学习语言与知识模式的阶段,相当于打基础。

真正昂贵的是后半程

Beam 的另一项重点是强化学习——模型尝试解决任务,再依据奖励信号调整行为。Reflection AI 称,这轮训练动用了 10.5K(1.05万张)NVIDIA GB300 GPU,持续四周,生成超过 100 million(1亿)条 rollouts。rollout 可以理解为模型从接到任务到尝试完成任务的一整段行动记录。

训练和评分还使用了约 1.3 billion(13亿)个 sandbox。sandbox 是隔离的运行空间,模型可以在里面执行代码或操作工具,而不影响外部系统。公司另准备了 one million(100万)个编程、Agent 和 STEM——科学、技术、工程与数学——环境。

大规模并行训练也带来一个麻烦:模型一边更新,一边仍在学习较早版本生成的记录,旧记录可能已经“过时”。Reflection AI 称,其新算法能让全异步强化学习保持稳定,甚至可以继续利用一天多以前产生的交互,但目前没有公开足够细节供外界复核。

少想几步,也可能答得更好

团队还加入了可控的长度惩罚:答对会得到奖励,不必要的输出则受到抑制。官方称,强化学习早期,Beam 的答案变短,表现反而提高;后期随着 Agent 能力增强,输出又变长,但新增 token 带来了进一步提升。用户可以通过 reasoning effort 参数选择推理强度,在回答长度、效果和计算预算之间取舍。

Reflection AI 还声称,Beam 在高级推理基准上达到与 GLM-5.2 相当的成绩,同时少用 3至4倍推理计算;在编程和 Agent 任务上可与 GLM 5.2 竞争,并接近 Qwen 3.8-Max。公司也承认,Kimi K3 的原始能力仍然领先。由于完整基准表、测试设置和推理预算尚未公开,这些比较目前只能视为厂商自述;材料中“GLM 5.2”与“GLM-5.2”的型号写法也不统一。

为什么这次发布有分量

Beam 把高端稀疏模型竞争推进到了开放权重一侧。开放权重意味着训练完成后的参数可供下载和运行,但不等于完整开源:许可证、训练代码和完整数据是否开放,仍要分别判断。

更关键的是,Beam 把竞争焦点从“总共有多少参数”转向“每次回答实际花多少计算”。如果后续材料能支持官方给出的能力与效率数据,501B 总参数、23B 激活参数的组合,可能成为企业部署编程和 Agent 模型时很有吸引力的折中。

局限与未知

  • 权重尚未正式发布,许可证、训练代码、数据开放范围也未披露。
  • 能力和效率比较缺少完整技术报告、基准设置及独立复测,暂不能坐实。
  • 训练规模、数据量和基础设施数字均来自 Reflection AI,同样有待外部验证。

供稿材料 SOURCES — 1

← 返回 2026-10-07 · 开源板块