Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.080 — 2026-09-22
NEWS 约 1 分钟

2.8T参数Kimi跑上16台GB10

16台GB10协同跑完整Kimi K3,单路约30 token/s,并发峰值136 token/s。

IMAGE — r/LocalLLaMA 日榜

把一个2.8万亿参数的模型搬进自己的机房,难点不只是“卡够不够多”,还要让多台设备像一台机器那样顺畅协作。参数是模型训练后保存的数值权重;规模到了万亿级,通常无法塞进单块普通加速卡。开发者 ciprianveg 在16台GB10节点组成的集群上运行了完整的 Moonshot AI Kimi K3,并公开了运行补丁、配置与构建脚本。

据作者在 Reddit 自述,这套系统执行代码生成和智能体任务时,Decode——模型逐个生成 token 的阶段——可持续约30 token/s,峰值约38 token/s;多请求并发吞吐峰值为136 token/s。Prefill——先读完整段输入、建立内部状态的阶段——达到约750至910 token/s。作者把提升归因于修改过的 NCCL 通信拓扑、双交换机网络和定制运行时。这个案例的价值不在于证明16台小型节点必然胜过其他方案,而是给超大模型私有化部署留下了一份少见的完整实测;上述性能数字目前均来自作者自报。


供稿材料 SOURCES — 1

← 返回 2026-09-22 · 开源板块