Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.081 — 2026-09-23
NEWS 7 信源 约 7 分钟

MiMo 2.6全家桶:小米从9B铺到万亿参数

从9B蒸馏版到超过1T旗舰,小米把一次公开强化学习做成了完整模型产品线。

IMAGE — OpenRouter 新模型上架
MiMo 2.6 全家桶:小米从 9B 铺到超过 1T

你要给一个 AI 安排工作,选择往往不只是“哪个最聪明”。在自己的机器上做实验,模型得足够小;在线批量处理任务,成本更重要;遇到复杂项目,又可能愿意多花钱换能力或速度。小米这次发布 MiMo-V2.6 系列,做的正是把同一代模型铺成多个档位:从 9B 蒸馏版,到 309B 稀疏模型,再到参数超过 1T 的旗舰与高速版本。

这也让几天前那场公开训练有了下文。我们此前报道过,MiMo 从 9 月 15 日起直播尚未完成的强化学习后训练。强化学习,简单说,就是让模型反复尝试任务,再依据反馈调整行为。六天里,两条训练任务各跑完 30 步,合计产生约 75 万条轨迹。小米 MiMo、纽约大学上海校区 RITS 与 TechNode 披露,Flash 和 Pro 的训练费用分别约为 85 万美元和 262 万美元。9 月 21 日上线的模型家族,便是这场“开着计价器训练”的落地结果。

一套模型,铺成几档生意

系列的中坚是 MiMo-V2.6-Flash。OpenRouter 页面显示,它采用 MoE(Mixture of Experts,混合专家)架构:模型共有 309B,也就是 3090 亿参数,但处理每个 Token 时只激活 15B。Token 可以理解为模型读写文字时切分出的基本单位。MoE 则像一个大型专家组,每次只请与当前问题有关的一部分人工作,以较少的实际计算调用更大的参数池。

往上是 MiMo-V2.6-Pro。OpenRouter 将它列为超过 1T 参数的旗舰模型,面向要求更高的任务。Pro-UltraSpeed 则使用同一个 Pro checkpoint——也就是同一份训练完成后的模型状态——把卖点放在生成速度上。页面宣称它在质量不变的情况下,输出速度约为 Pro 的 10 倍;但现有观测并不能直接支持这个数字。

OpenRouter 当时展示的 P50 吞吐量,即一半请求高于、一半请求低于的中位速度,Flash、Pro 和 Pro-UltraSpeed 分别为每秒 43、38 和 131 Token。照此计算,UltraSpeed 约为 Pro 的 3.45 倍,而非 10 倍。这些数字来自动态平台观测,硬件和采样窗口也未必相同,因此既不能证实“10 倍”,也不适合当作固定规格。

价格把三个档位的差别写得更直白。OpenRouter 标价中,Flash 每百万输入、输出 Token 分别为 0.14 和 0.28 美元;Pro 为 0.435 和 0.87 美元;UltraSpeed 则升至 4.35 和 8.70 美元。换句话说,高速版不是白送的加速,而是把等待时间变成一个明确的付费选项。

三款模型都提供 1,048,576 Token、约 100 万 Token 的上下文窗口,并具备原生多模态能力。上下文窗口是模型一次能读入和参考的信息总量;多模态意味着它除文字外还能接收图像、视频和音频。这样的组合适合长代码库、工具调用记录或跨多轮的 Agent 任务。Agent 指能读取信息、调用工具并连续完成步骤的 AI 系统。不过,能装下 100 万 Token,不等于模型能同等准确地利用其中每一处信息。

大模型之外,还有一只 9B“小杯装”

完整梯度里最值得注意的,可能不是最大的 Pro,而是 MiMo-V2.6-Distill-Qwen-9B。它以 Qwen3.5-9B 为基础,用 MiMo 生成的数据做监督微调。蒸馏可以理解为让小模型学习大模型的输出或行为,把部分能力压进更容易部署的体积。小米将这个 SFT checkpoint——经过示范答案训练、但尚未继续做强化学习的版本——作为 Agent 强化学习研究的起点开放出来。

官方 Hugging Face 页面称,其训练数据混合共含 77.4B Token,其中 27.2B 会直接计入训练损失;内容覆盖代码、网络安全、通用任务和视觉任务。按官方技术报告给出的评测,蒸馏版相对原始 Qwen3.5-9B,在 SWE Pro 上从 32.0 提至 44.6,在 AutomationBench v1.0.6 上从 5.0 提至 30.3,在 Terminal Bench 2.1 上从 27.0 提至 37.1。另有多项提升来自小米内部 mini 测试集,参考价值需要与公开基准分开看。

这只 9B 模型补上了产品线的另一端:Pro 追求能力上限,Flash 在规模与计算量之间折中,UltraSpeed 用更高价格换吞吐,蒸馏版则把实验与部署门槛往下压。系列中另有 Flash-RL 和 Pro-RL 两个公开检查点,官方分别把它们定位为“效率均衡版”和“旗舰版”。

真正落地的是后训练路线

这套产品梯度之所以值得关注,不只因为型号多,而是它把此前公开展示的训练方法接到了可选择的产品上。

小米称,V2.6 同时扩大三样东西:强化学习的计算量、训练环境的多样性,以及 grader compute——负责评价模型答案的计算量。它还把代码、通用 Agent、视觉和网络安全任务混进同一次强化学习,而不是每个领域单独训练。评判环节也不只看“通过或失败”,还会比较同组答案,把奖励更多分给质量更高、路径更短的解法。说白了,学生不只是多做题,批改标准也跟着变细。

官方结果显示,Pro 在 DeepSWE v1.1、AutomationBench v1.0.6 和 Toolathlon-Verified 上分别得到 71.9、53.1 和 76.9;Flash 分别为 67.9、52.3 和 73.6。OpenRouter 转述的 Artificial Analysis 数据则给出 Pro 的 Intelligence Index 46.3、HLE 49.4%、AA-LCR 86.3% 和 GDPval-AA 58.7%。这些数字说明官方正在把模型放进代码与工具型任务中检验,但不同基准衡量的能力不同,不能合并成一个简单的“聪明程度”。

更重要的变化是选择方式。开发者不必只在“用不用 MiMo”之间二选一,而可以按本地研究、成本敏感的线上任务、旗舰能力或高吞吐需求选档。一次昂贵的后训练,由此被拆成了从 9B 到超过 1T 的不同入口。

局限与未知

  • “UltraSpeed 约 10 倍输出速度”和“质量不变”目前主要是产品页面主张;同页动态吞吐数据只显示约 3.45 倍,仍需同硬件、同负载测试。
  • Pro 的 Artificial Analysis 分数来自 OpenRouter 转述,尚需回查原始榜单的版本、日期和评测设置;官方基准与内部测试也不能代替真实业务验证。
  • 百万 Token、多模态和持续自我改进描述了能力方向,却没有证明模型在所有长任务、输入类型和 Agent 环境中都能稳定兑现。

供稿材料 SOURCES — 7

← 返回 2026-09-23 · 开源板块