Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.081 — 2026-09-23
NEWS 约 1 分钟

俄罗斯自研80B稀疏模型入场

Yandex开放自研80B稀疏基础模型,每次生成仅激活约3B参数

IMAGE — r/LocalLLaMA 日榜

大模型像一家公司:员工越多,能力上限越高,但每项任务没必要全员出动。Yandex 于 9 月 21 日开放 AliceAI-Foundation-80B-A3B-Base,正是这一路线。它共有 800 亿参数,处理每个 Token(模型读取或生成的文字单位)时只激活约 30 亿参数,试图用较低的单次计算量承载更大的模型容量。

据 Yandex 与 Hugging Face 模型卡,这是一款从零训练的俄英双语基础模型——尚未调教成聊天助手,主要供开发者继续训练和部署,并非在 Qwen 或 Llama 上微调而来。其 MoE(混合专家)层会从 512 个“专家”模块中为每次计算选出 10 个,再搭配 1 个共享专家;模型共 48 层,最长上下文为 262,144 Token。它的意义不只在参数规模,而是为 Qwen、DeepSeek 之外增加了一条独立模型谱系。Yandex 将其称为实验版本,用来验证未来统一推理模型的架构选择;目前性能比较主要来自官方测试,实际能力仍待外部评测。


供稿材料 SOURCES — 1

← 返回 2026-09-23 · 开源板块