Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.064 — 2026-09-06
NEWS 约 1 分钟

Qwen新模型在手机CPU本地运行

Qwen 稀疏大模型在小米手机完全本地运行,但速度与 CPU 独立运行仍待验证。

IMAGE — r/LocalLLaMA 日榜

把大模型装进手机,难点不只是“能不能打开”,还要在有限内存里真正跑起来。据 Reddit r/LocalLLaMA 原帖,发布者在 Xiaomi 14T Pro 上完全本地运行了 Qwen3.8-Flash-Next-UD-IQ3_XXS,使用的应用是 BigMoeOnEdge;这意味着无需把问题发往云端,也没有使用手机 GPU。

值得注意的是模型的体量。据 Qwen 团队技术报告,Qwen3.8-Flash-Next 是稀疏 MoE——“专家混合”架构,每次生成一个 token(可理解为一小段文字)只调用部分子网络。主模型共有 125B 参数,但每个 token 激活 6B;另有 51B 参数的 n-gram 嵌入表放在加速器之外。配合 IQ3_XXS 量化版本,也就是用更低精度压缩权重,它才有机会挤进移动设备的内存与算力预算。

不过,这目前更像一次“跑通”展示。原帖没有给出复现步骤或完整速度数据,也未说明是否有 NPU——手机里的神经网络专用处理器——参与,因此还不能确认计算全由 CPU 独立完成,更无法判断实际使用是否流畅。


供稿材料 SOURCES — 1

← 返回 2026-09-06 · 开源板块