你让 AI 处理一个复杂项目:先读完整个代码仓库,再找问题、调用工具、修改文件,还要根据报错继续行动。难点不只是“会不会答题”,而是它能否在漫长过程中记住上下文,并把每一步的时间和计算成本控制住。A.X K2 想解决的正是这件事:它是一款从零训练——从随机状态开始建立全部能力,而非改造现有模型——的 Agent 基础模型,目标是支撑规划、工具调用和多步骤执行。
它最醒目的数字是 688B,也就是 6880 亿参数。参数可以理解为模型训练后留下的数值旋钮,决定它如何处理输入。但这不等于每生成一个词,都要动用全部 6880 亿参数。A.X K2 采用 MoE(Mixture-of-Experts,专家混合)架构:像医院分诊一样,每次只把当前内容交给少数“专家”子网络。模型共有 688B 参数,单次实际激活 33B。
本文所有模型表现与效率数据均来自开发团队发布的《A.X K2 Technical Report》,尚无独立第三方评测,以下数字应视为作者报告结果。
大模型,但不是每次都全开
A.X K2 有 256 个可路由专家,每个 token——模型处理文字时切分出的基本单位——会激活其中 8 个。相比前代 A.X K1,它把专家数从 192 增至 256,但把激活参数量维持在 33B。思路很直接:扩大模型存放知识和能力的总容量,同时避免单次推理成本跟着总参数量一起膨胀。
这种选择也受现实资源约束。团队给出的训练条件是 512 张 NVIDIA B200 GPU,训练约 70 天。模型共处理约 8.5T tokens,其中约 8.2T 用于预训练,其余用于后训练。A.X K1 使用了 10T tokens,因此 K2 并不是靠“多喂数据”取胜。
团队先从约 16.2T tokens 的候选池中筛选数据,再按难度逐步收紧。训练分为通用知识、高质量推理和长上下文适配三个阶段。语料覆盖网页、代码、STEM、推理、书籍与合成数据,并提高了 Agent 轨迹、软件工程和代码仓库级数据的比例。这里的“轨迹”,指模型完成任务时经历的调用工具、读取结果和继续决策等连续步骤。
技术报告称,K2 在各项测试中均优于 K1,部分基准提升超过 30 个百分点。不过报告没有在摘要结论中点明这些基准及完整分数,因此更稳妥的解读是:团队认为更严格的数据筛选和训练编排提高了 token 利用效率,而不是参数规模单独带来了提升。
长任务不能把所有旧内容重读一遍
Agent 的任务越长,模型需要回看的内容越多。普通注意力机制会让当前位置与大量历史位置逐一建立联系,文本越长,计算增长越快。
A.X K2 为此引入 Sparse Gated Attention(SGA,稀疏门控注意力)。它像给长文加了一名索引员:面对每个 query——当前正在处理的信息——先从历史内容中挑出最相关的位置,再集中读取。无论上下文多长,每个 query 最多读取 2,048 个位置。在 128K 上下文中,这相当于只看约 1.6%;延伸到 256K 时,比例降至约 0.8%。
模型先原生训练到 32K,再训练到 128K。所谓“原生”,是训练时确实让模型处理这一长度,而不只是部署后临时拉长。达到 128K 后,团队再加入稀疏索引器,并先冻结模型主体,只训练这名“索引员”。它从一开始就在稀疏选择结果上学习,不必先计算完整注意力分布,因此适配成本更低。
作者报告称,加入 SGA 前后,LongBench 得分从 62.80 变为 62.99,未见可测的质量损失;模型在最长 256K 的 RULER 长上下文测试中得到 94.6。需要区分的是:128K 是原生训练长度,256K 是扩展后的评测长度。
先压住异常值,再谈低精度部署
模型部署时,工程团队常用较少的数字位数表示参数和中间结果,以节省显存并加快计算。但少数特别大的数值会挤占表示范围,像一张表里混入几个极端值,其他数据就更难精细记录。
A.X K2 使用 Gated Norm(GN,门控归一化)压制这类异常激活,让训练更稳定,也让低精度部署更容易。代价是训练吞吐量约下降 5%。团队报告称,在 4-bit NVFP4 格式下,模型精度与 FP8 的差距保持在 1 分以内。不过报告没有说明这一差距对应哪些任务、如何汇总,也没有给出最差情形,因此不能据此推断所有应用都只损失不到 1 分。
简单问题不必每次深思
长推理链会增加响应时间和服务成本,但很多问题只需要直接回答。A.X K2 用 Think-Fusion 把 thinking 与 non-thinking 两种模式放进同一个模型:前者生成较长的中间推理过程,后者追求简洁和低延迟,使用者可按请求切换。
团队为同一提示配对制作两类回答,让模型依据明确的控制 token 切换,而不是靠题目类型猜测是否需要思考。监督微调数据中,两种模式的 token 比约为 13:1。之后的多阶段强化学习——通过奖励信号继续调整模型行为——共同训练指令遵循、人类偏好、工具使用和安全能力。
为什么值得关注
A.X K2 的看点不只是“又一个更大的模型”。它把 Agent 所需的几项能力放进同一套工程取舍:MoE 扩大总容量但控制激活规模;精选的工具与软件工程数据面向实际任务;SGA 降低长上下文负担;GN 服务低精度部署;Think-Fusion 则让使用者按问题难度分配推理成本。
技术报告还称,A.X K2 在数学与韩语基准上可匹敌或超过强势 open-weight——权重可获得——模型。它同时被放在韩国政府的 Sovereign AI 基础模型项目中,意图建设更理解韩语与本地文化、可由本地控制的基础设施。不过材料未提供逐项基线名称和完整成绩,暂时不足以把这一结果扩写成普遍领先。
局限与未知
- 所有效果结论目前都来自开发团队自身,缺少独立复现和第三方横向评测。
- “部分基准提升超过 30 个百分点”、NVFP4 与 FP8 差距等结论缺少足够完整的逐项结果,适用范围仍不清楚。
- 报告展示了训练与架构配方,但真实 Agent 产品中的任务成功率、失败恢复能力和端到端成本,仍需实际部署检验。