你有一台内存不少、显卡却装不下大模型的电脑。以往,这像是仓库够大,工作台却太小:材料放得下,真正加工时却周转不动。Strata想解决的正是这个问题。它让系统内存与GPU显存共同承载模型,用前者补容量,用后者争取计算速度。近期,两名Reddit用户在差异很大的消费级硬件上报告了亮眼的Qwen推理速度,让这条混合内存路线突然值得追踪。不过,目前证据仍是未经正式测评的社区报告,具体数字不能视为普适性能。
大模型不必全塞进显卡
系统内存通常容量较大,但离GPU更远;显存速度快,却往往装不下大模型。Strata采用的是“异构推理”——让CPU、GPU及其各自的内存共同完成一次模型运行。关键不只是把模型拆开放,还要安排哪些权重留在显存、哪些放在系统内存,并控制两边搬运数据的成本。
Reddit用户EmPips称,Qwen3.8 Next的IQ3_XXS量化权重略低于80GB。量化,就是用较低精度保存模型参数,以减少内存和带宽需求,代价可能是输出质量变化。在DDR4系统内存和Radeon RX 7900 XTX显卡上,他报告Strata的生成速度稳定在约45至70 token/s。token是模型处理文字时使用的基本片段,token/s表示每秒生成多少片段。
同一用户称,在同一台机器上,经过调优的Llama.cpp最高约为22.5 token/s。这个对照很醒目,但帖子没有交代完整测试流程、输入内容和所有参数。他还转述,配备12GB或16GB显存显卡的其他用户得到了相近结果,DDR5用户明显更快;原帖没有附这些观察的原始数据或链接。
第二台机器更快,但不能横着比
另一名Reddit用户只在标题中给出结果:一台功耗受限的RTX 5090配合96GB DDR5-6400内存,运行Qwen3.8-Flash-Next的IQ3_S版本和128k上下文时,decode达到150至200 token/s,prefill达到“5–6k”。
这里要区分两个阶段。Prefill是模型先读完输入;decode是随后逐个token生成回答。它们的瓶颈不同,数字不能混为一个“总速度”。该帖没有正文,“5–6k”大概率指token/s,但原文没有明确写出单位;“128k tokens(8-bit)”中的8-bit究竟指哪部分,也不清楚。
两组成绩更不能直接比赛。它们使用不同显卡、不同内存、不同量化格式,模型名称也分别是Qwen3.8 Next与Qwen3.8-Flash-Next,是否属于同一模型或变体尚不明确。现阶段,两条材料能共同说明的只有一件事:当电脑拥有较大系统内存、显存又有限时,Strata可能仍能为超大模型或长上下文提供较高吞吐。
为什么现在值得看
我们9月29日报道过把模型分层放进显存、系统内存和SSD的方案。Strata延续了利用不同存储层级的思路,但这次焦点更集中:系统内存与GPU怎样协同,以及用户真正等到答案时到底有多快。
项目的迭代速度也很能说明社区热度。据GitHub的Niko1221/Strata发布记录,Strata于2026年9月24日现身GitHub,头四天连续发布了十三个版本。早期版本曾出现一种死锁:RTX 4090占用率显示100%,功耗却很低,生成数千个token后永久停住。原因是部分CPU专家线程误以为无事可做而休眠。修复后,开发者又加入线程转储和超时报告。这个插曲提醒我们,混合推理的难点不只在算得快,也在让不同硬件始终正确配合。
局限与未知
- 两项结果都来自Reddit用户,不是同条件、可复现的正式基准;S2甚至只有标题,缺少功耗上限、批大小和测量方法。
- IQ3_XXS“质量更好”、Q2“不值得推荐”只是S1作者的主观判断,没有任务、指标或对照数据,不能据此下质量结论。
- Strata仍需官方技术资料、完整实验设置,以及与Llama.cpp在同一模型、量化、上下文和硬件条件下的比较,才能判断亮眼速度究竟来自架构、调优还是测试口径。