想在自己的电脑上跑大模型,常见瓶颈不只是“能不能装下”,还有回答是否足够快。一名开发者针对单张 AMD Radeon R9700 做了推理优化,并用 Qwen3.8 27B NVFP4 测试。NVFP4 是一种低精度量化格式——用更少显存保存和计算模型数据。作者自述,优化后整体性能翻倍;在 JSON 任务中,单请求 decode(逐个生成文本片段的阶段)达到 153.1 token/s,聊天与散文任务则分别为 67.1 和 69.2 token/s。
并发测试中,同时处理 8 个请求的总吞吐达到 471 token/s;prefill——模型先读完提示词、等待首字输出的阶段——最高测得 3,619 token/s。它说明消费级 AMD GPU 的本地推理仍有明显的软件优化空间,也提醒读者:最高数字来自特定任务,并不等于所有聊天场景都能达到同样速度。上述结果来自作者发布的 BetterBench 测试,材料未披露优化细节、功耗、模型精度变化或独立复测结果。