Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.081 — 2026-09-23
NEWS 3 信源 约 5 分钟

小米用直播炼出开源第一

小米把大模型强化学习搬进直播间:350万美元、30步训练,连故障与工具链一起公开。

IMAGE — DeepSeek (via Google News)

你看一场厨艺直播,真正有用的往往不只是最后端出的菜,而是火候怎么调、失败后怎么补救。训练大模型也一样。多数公司只发布成品,小米这次却把 MiMo-V2.6 的强化学习后训练搬上直播:花了多少钱、模型怎样进步,乃至中途爆显存,都公开展示。它因此提供了一个少见的样本:前沿模型能否以相对可控的成本训练,并让外界看见过程。

这里的强化学习,是让模型反复完成任务,再根据结果和评分继续调整行为,常用于增强推理、工具使用和 Agent——能自主拆解并执行任务的 AI——能力。这次公开的是模型完成基础训练后的迭代过程。主要数字来自小米公开仪表盘及量子位对技术报告的报道,尚缺少完整榜单和第三方复测。

直播不只播成功

MiMo-V2.6-Pro 和 Flash 都完成了 30 个训练 Step,也就是 30 轮迭代。量子位报道,Pro 用时5天3小时,成本约260万美元;Flash用时3天10小时,成本约90万美元。总成本为350万美元,约合人民币2344万元。

更值得注意的是,直播没有剪掉事故。根据小米 MiMo 公开训练仪表盘,Pro 跑到第17步时,不同“专家”子网络负载失衡,导致 GPU 显存耗尽,训练不得不重启。团队调整并行训练策略后继续运行,故障说明也留在页面上。

这里的“专家”来自 MoE(专家混合)架构:模型内部有多个子网络,每次只调用其中一部分。MiMo-V2.6-Pro共有1.02万亿参数,但一次请求实际参与计算的“激活参数”为420亿。前者像整支团队的人数,后者更接近一次任务真正上场的人数。

30步换来了什么?

据量子位报道,训练结束后,Flash的平均通过率相对提高25%,Pro提高12%。在 DeepSWE v1.1——考察 Coding Agent 能否在真实开源代码库中持续工作的测试——上,Pro从58.4分升至72.57分,Flash从48.7分升至65.68分。这个结果说明训练后的模型在该项未直接用于训练的测试中也有提升,但仅凭一项评测,还不能把它扩大解释为普遍的“样本外泛化”。

Pro在 Artificial Analysis Intelligence Index 获得46分,并按该机构当时的分类位列开源模型第一。这个“第一”有明确边界:它只对应特定指数、特定时间和特定开源分类,不等于所有能力上的综合冠军。

另一项 AutomationBench 测试中,Pro得分53.1,高于报道所列 Claude Opus 5 的50.3和 GPT-5.6 Sol 的45.8。Artificial Analysis的测算还显示,Pro完成一项 Intelligence Index 任务平均成本为0.13美元;同为46分的 Grok 4.7 xHigh 为3.74美元,约是其29倍。这些都是单一信源所述,评测配置仍需更多材料核对。

真正稀缺的是“怎么炼”

开源权重,是把训练完成后的核心参数交给外部开发者,让他们自行部署、测试和改造;但只有权重,并不代表训练数据和方法也公开。小米这次进一步开放了 Pro、Flash 权重、完整技术报告、7000多个强化学习任务环境、端到端训练框架和可组合的 mini-harnesses——可理解为让模型操作不同任务的一组轻量工作台。

它还开放了 MiMo-V2.6-Distill-Qwen-9B 的监督微调版本。该模型以 Qwen3.5-9B 为底座,使用 MiMo 生成的774亿 Token 数据训练。Token是模型处理文字时切分出的基本单位。这些资源让外部团队拿到的不只是“成品”,还有训练场、评分工具和流水线。

这与我们9月21日关注的趋势相接:公开权重、兼容接口和低价,正在帮助中国模型进入海外企业工作流。MiMo-V2.6继续沿用V2.5的 API 定价,Pro每百万Token输入、输出约3元和6元,Flash约1元和2元;UltraSpeed模式最高约900 TPS,即每秒处理约900个Token。对小米而言,公开过程既是在证明训练能力,也是在争取开发者。

模型还把代码、图像、视频、3D和音乐等不同模态放进同一能力版图。“多模态”就是让一个模型处理不止文字的一类信息。相比单张榜单截图,这种能力范围加上完整工具链,更能解释它为何值得关注。

局限与未知

  • “开源第一”目前只能限定在 Artificial Analysis 的特定指数与时点,不能泛化成全面领先。
  • 成本、训练增益和多数评测数字主要来自小米公开材料及单一报道,缺少独立复测和完整配置。
  • 罗福莉称其研究创新和工程挑战超过自己参与的 DeepSeek-R1,这是参与者的主观评价;现有报道对她参与 DeepSeek-V2 还是 DeepSeek-R1 的表述也不一致。

供稿材料 SOURCES — 3

← 返回 2026-09-23 · 科技板块