Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.061 — 2026-09-03
NEWS HN 225 约 1 分钟

104GB模型挤进48GB Mac

slotstream 从 SSD 按需读取权重,让 104GB 模型在 48GB Mac 上以约 12 tok/s 运行。

IMAGE — Show HN 高分帖(新项目发布流)

一台只有 48GB 统一内存的 Mac,按常规办法装不下 104GB 的模型权重。slotstream 的思路像是边做菜边从储藏室取料:把 Qwen3.8-Flash-Next——一个 1250 亿参数的混合专家模型——以 4-bit 形式留在 SSD,需要哪部分再读入内存,而不是一次全部加载。

项目作者称,在 48GB M5 Pro 上,实测峰值内存约 32GB,热启动后的生成速度约为每秒 12 个 token(模型生成文字时处理的基本单位);引擎启动约 2 秒,因为起初只加载 3.8GB 的主干。它还兼容 Ollama 和 OpenAI 的聊天 API——也就是常见客户端所用的调用接口,通常换个服务地址就能接入。

这展示了分层卸载的实际价值:消费级机器也能尝试远大于内存容量的模型。代价是 SSD 容量与读取速度会成为瓶颈;项目要求约 110GB 空闲磁盘。其余内存档位的速度只是工具估算,并非真机实测。


供稿材料 SOURCES — 1

← 返回 2026-09-03 · 开源板块