大模型像一家公司:员工越多,能力上限越高,但每项任务没必要全员出动。Yandex 于 9 月 21 日开放 AliceAI-Foundation-80B-A3B-Base,正是这一路线。它共有 800 亿参数,处理每个 Token(模型读取或生成的文字单位)时只激活约 30 亿参数,试图用较低的单次计算量承载更大的模型容量。
据 Yandex 与 Hugging Face 模型卡,这是一款从零训练的俄英双语基础模型——尚未调教成聊天助手,主要供开发者继续训练和部署,并非在 Qwen 或 Llama 上微调而来。其 MoE(混合专家)层会从 512 个“专家”模块中为每次计算选出 10 个,再搭配 1 个共享专家;模型共 48 层,最长上下文为 262,144 Token。它的意义不只在参数规模,而是为 Qwen、DeepSeek 之外增加了一条独立模型谱系。Yandex 将其称为实验版本,用来验证未来统一推理模型的架构选择;目前性能比较主要来自官方测试,实际能力仍待外部评测。