你可以把训练大模型想成几千人共同完成一张巨型拼图。人再多,如果彼此传递图块太慢,大量时间仍会浪费在等待上。华为这次提前推出昇腾960,真正想解决的就是这个问题:不只提高一颗芯片的速度,而是把计算、内存、光互联和缓存连成一套系统,让数千颗芯片更像一台机器。
9月17日,华为在全联接大会2026上宣布,昇腾960DT将于2027年第一季度准备就绪,比原计划提前三个季度。与它同时亮相的,还有4096卡超节点、Hi-ONE光互联和PB级KV Cache系统。这意味着华为追赶英伟达的落点,已经从“能不能造出替代GPU的芯片”,转向“能不能交付一整套可扩展的AI计算基础设施”。不过,除发布时间和4096卡配置获得两个来源相互印证外,本文涉及的大部分性能、功耗和可靠性数字仍来自华为发布会或内部仿真,尚缺少第三方测试。
提前出牌,但重点不只是一颗芯片
昇腾是华为面向AI训练和推理的计算平台,也是中国市场替代英伟达GPU及CUDA生态的重要路线。按照InfoQ转述的发布会信息,昇腾960DT支持2 PFLOPS FP8和4 PFLOPS FP4算力。FP8、FP4指用较低数字精度完成计算;PFLOPS则衡量每秒可执行多少千万亿次浮点运算。精度越低,通常越能换取更高吞吐量,但不同产品之间必须在相同计算口径下比较。
华为称,960DT片上HBM最大容量为288GB,带宽为9.6TB/s。HBM是紧邻计算芯片的高带宽内存,作用像一张取用极快、但空间昂贵的工作台。另一款昇腾960PR计划于2027年第三季度就绪,支持8 PFLOPS FP4,也比原计划提前一个季度。华为还计划保持“一年一代”,在2028年和2029年推出昇腾970和980。
这些规格说明芯片本身仍在提速,但华为此次把更多篇幅留给了“超节点”——通过高速互联把大量AI芯片组成一个更大的计算单元。原因很直接:模型跨越的芯片越多,通信越容易成为瓶颈。按华为马尔科夫实验室的仿真,传统8卡服务器组成的10万卡集群,芯片通信可能占去超过40%的训练时间;改用4K规模超节点后,MFU可提高2.75倍。MFU是模型浮点算力利用率,也就是机器的理论能力中,真正用于模型计算的比例。
4096张卡,要像一台机器工作
本次公布的昇腾960超节点包含4096张卡,最大提供8E FP8算力和1PB HBM容量。PB约为一千万亿字节。这里的意义不只是数字大,而是系统试图让数千张卡共享更紧密的计算和内存体系,减少跨服务器来回搬运数据的代价。
连接这些芯片的是Hi-ONE,一种NPO(Near-Packaged Optics,近封装光学)产品。它让电信号更早转换成光信号,以缩短高速电信号的传输距离。华为称,Hi-ONE单引擎传输容量为7.2T,已经量产。一个4096卡超节点使用5500个Hi-ONE,可替代约4.8万颗800G可插拔光模块;据华为口径,这能降低超过550千瓦功耗,使无故障运行时间增加一倍,系统可用度达到99.8%。这些结果目前没有材料说明测试条件,也不能直接拿来与英伟达系统横向比较。
华为计划在2027年第二季度推出风冷版昇腾960超节点,第三季度推出液冷版。这个节奏表明,960DT第一季度“准备就绪”并不等于完整系统当季上市:芯片先到,整机随后跟进。
PB级缓存,补上推理的另一块短板
训练需要芯片彼此高效通信,长对话和Agent应用还会遇到另一个问题:如何保存模型已经读过的内容。
KV Cache是模型生成文字时留下的中间计算结果,像一张随时要翻看的草稿纸。没有它,模型每输出一个词,都可能重新计算前文。材料称,Agent上下文正从4K扩展到100万Token,长度约增加250倍;Token是模型处理文字时使用的基本片段。上下文越长、并发请求越多,这张“草稿纸”就越大。
华为因此提出分层缓存:最常用的数据放在NPU内部HBM,其次放在服务器DRAM和本地SSD,更多内容则进入整个集群共享的PB级缓存。OceanStor M900承担所谓L3.5层,让NPU一跳访问全局缓存。华为披露,它可把访问SSD池的数据搬运从5次减到1次,使I/O时延和首个Token出现前的等待降低超过50%。这套设计说明,华为销售的不再只是算力,还包括如何存放和调度模型的“临时记忆”。
为什么这比单芯参数更值得看
华为此前已经展示过用系统规模弥补单芯差距的路线。据Tom's Hardware报道,2025年的CloudMatrix 384用384颗Ascend 910C组成整机,在部分纸面指标上超过英伟达GB200 NVL72,但整套系统功耗约559千瓦,接近对手四倍。昇腾960延续了“以系统换单芯差距”的思路,同时尝试用新的光互联降低规模扩张带来的功耗和可靠性压力。
真正的竞争还包括计算生态——编译器、软件库、框架适配和开发工具。华为称,昇腾已覆盖PyTorch、Triton、vLLM等90多个第三方社区,并适配超过200个开源大模型。只有现有模型能够方便迁移、稳定运行,4096张卡组成的机器才不只是硬件展示。
局限与未知
- TechCrunch指出,华为此前曾称Atlas 960 SuperPoD可扩展至15488张卡,而本次公布的是4096卡系统。现有材料没有解释两者是不同产品形态、配置还是规划阶段,不能简单判断为规模缩水。
- 8E FP8、芯片PFLOPS、MFU提升和功耗数字涉及不同精度、系统配置及仿真条件。在口径统一、第三方测试公布前,不宜据此得出其已经超过哪款英伟达产品的结论。
- 芯片和整机仍要到2027年分阶段就绪或上市。量产规模、软件迁移成本以及真实业务中的稳定性,目前都没有披露。