Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.070 — 2026-09-12
NEWS 约 1 分钟

DeepSeek参数口径被重新核算

社区重查权重文件:V4.1 Flash应理解为748B总参数、552B基础参数

同一个模型,为什么会同时出现 485B、522B 和 552B?关键不一定是谁算错了,而是大家数的东西不同。Reddit 社区用户 DistanceSolar1449 逐项检查 Hugging Face 上的 Safetensors——一种常见的模型权重文件格式——后称,DeepSeek V4.1 Flash 更准确的口径应是约 748B 总参数、552B 基础参数。这为本刊此前采用的“552B backbone parameters”补上了重要限定:552B 不是整个模型的全部参数。

按这名用户的核算,主模型约 551.566B,其中 FFN 专家部分约 543.582B;再加上约 196.929B 的 engram、14.225B 的 DSpark/MTP,以及约 0.485B 的视觉编码器,总量接近 748B。这里的“基础参数”并非统一标准,发布方可能不把辅助预测头、记忆模块等算进去。

485B 等较小数字还可能来自 FP4 打包的误读:FP4 权重紧密存储时,一个字节可装两个参数,若把字节数直接当参数数,就会少算。对 MoE——每次只启用部分“专家”的模型——来说,总参数、实际激活参数和计算量本来就是三回事。这次纠正改变的是规模口径,并不等于模型每次运行都会动用全部 748B 参数;目前核算来自社区帖文,尚非官方更正。


供稿材料 SOURCES — 1

← 返回 2026-09-12 · 开源板块