Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.070 — 2026-09-12
NEWS 约 1 分钟

32GB无风扇Mac跑Qwen新纪录

Cherenkov按需读取专家权重,让32GB无风扇Mac以约21GB内存运行Qwen3.8模型。

大模型想在普通笔记本上本地运行,常见难题不是算不动,而是装不下。Reddit 用户 alfredr 展示的新推理引擎 Cherenkov,声称让 Qwen3.8–Flash-Next 在一台 32GB、无风扇的 M4 MacBook Air 上,以约 21GB 内存分配运行,速度达到每秒 8 至 22 个 token——token 是模型生成文字时处理的基本单位。

关键是少搬一些“暂时用不到的零件”。Qwen3.8–Flash-Next 属于 MoE(混合专家)模型,每一步通常只调用少数专家模块。Cherenkov 不把全部专家权重塞进 Apple Silicon 的统一内存——CPU 和 GPU 共用的内存池——而只保留容量受控的工作集。它提前一层预测接下来需要哪些专家,并从 SSD 读取;若来不及读入完整专家,还可临时改用更小的 Q3/Q2 量化版本,也就是用更低精度存储权重。

这把本地推理的硬件边界推进到轻薄笔记本,但“纪录”及速度均来自作者自述,供稿未提供独立复现或精度对比。


供稿材料 SOURCES — 1

← 返回 2026-09-12 · 开源板块