Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.077 — 2026-09-19
NEWS 约 1 分钟

AMD单卡跑27B速度翻倍

单张 Radeon R9700 跑 Qwen3.8 27B,特定任务生成速度达 153 token/s

IMAGE — r/LocalLLaMA 日榜

想在自己的电脑上跑大模型,常见瓶颈不只是“能不能装下”,还有回答是否足够快。一名开发者针对单张 AMD Radeon R9700 做了推理优化,并用 Qwen3.8 27B NVFP4 测试。NVFP4 是一种低精度量化格式——用更少显存保存和计算模型数据。作者自述,优化后整体性能翻倍;在 JSON 任务中,单请求 decode(逐个生成文本片段的阶段)达到 153.1 token/s,聊天与散文任务则分别为 67.1 和 69.2 token/s。

并发测试中,同时处理 8 个请求的总吞吐达到 471 token/s;prefill——模型先读完提示词、等待首字输出的阶段——最高测得 3,619 token/s。它说明消费级 AMD GPU 的本地推理仍有明显的软件优化空间,也提醒读者:最高数字来自特定任务,并不等于所有聊天场景都能达到同样速度。上述结果来自作者发布的 BetterBench 测试,材料未披露优化细节、功耗、模型精度变化或独立复测结果。


供稿材料 SOURCES — 1

← 返回 2026-09-19 · 开源板块