八张旧 AMD 卡,拼出 256GB 推理机
想在家里运行大模型,最先撞上的往往不是算力,而是显存:模型装不进去,再快的显卡也无从发挥。一位 Reddit 用户给出了一条很不寻常的路线。他没有购买少数昂贵的新卡,而是用八张退役的 Radeon Pro V620 拼出 256GB 显存,再为它们改造推理软件。
据设备作者在 r/LocalLLaMA 的自述,这套机器运行其所称的 Qwen3.8-Flash-Next 时,解码速度达到每秒 60 至 100 token,预填充超过每秒 3000 token。token 是模型处理文字的基本片段,不能直接换算成汉字;预填充是先读完用户输入,决定模型多久开始回答,解码则是随后逐个生成 token,决定回答持续输出得多快。
不过,全部结果都来自作者本人,没有代码仓库、复现实验或独立测试。下面的数字应视为一份有吸引力的个人实践记录,而不是已经验证的通用结论。
便宜显存不是插上就能用
Radeon Pro V620 是较旧的 RDNA2 企业级云游戏显卡,每张有 32GB 显存。八张合计 256GB,可以容纳单张卡装不下的模型。多卡推理的思路像把一件大行李拆进八只箱子:容量够了,但箱子之间还要不断交接物品。卡间传输和负载不均,都可能让速度远低于简单的八倍叠加。
作者称自己数月前以约每张 350 美元购入这些卡,并以“2800 美元机器”为标题。但他也承认标题略具误导性:现在未必还能以这个价格买到,帖子也没有说明 2800 美元是否包含主机、供电、转接设备等全部成本。因此,更准确的说法是“约 2800 美元的显卡方案”,而不是一份可以照单采购的整机报价。
真正的难点也不是凑齐八张卡,而是让软件驾驭它们。作者此前使用 llama.cpp,同一模型的预填充速度约为每秒 350 至 450 token;vLLM 则无法直接在这些旧卡上运行。vLLM 是面向大语言模型服务的开源推理引擎,主要优化批处理、显存管理和请求吞吐,在这里还要协调模型跨多张显卡执行。
作者一度准备卖掉这些卡。最后,他让 Claude 协助编写、测试和反复修改面向 RDNA2 的计算内核,并做出一个定制 vLLM 分支。按其测试,预填充超过每秒 3000 token,相当于原方案速度的约 6.7 至 8.6 倍。帖子称其“快约 800%”,但若严格理解“快 800%”应是原来的九倍,因此这个说法更接近概括性宣传。
60 至 100 token/s 是怎么来的
这不是原版软件、原始精度模型和常规设置下的成绩。作者使用了自行量化的模型:路由专家采用 W4A16,即权重以较低的 4 位精度保存、计算激活保持 16 位;其他部分维持 BF16,一种常用于模型计算的 16 位数字格式。量化可以节省显存和计算量,但也意味着结果不能直接外推到未量化模型。
多卡配置采用 PP=4,也就是四段流水线并行,把模型的不同阶段分给不同设备;测试没有使用 tensor parallel,即没有把同一层计算进一步拆到多卡。并发数为 1,表示一次只测一个请求。因此,这组结果不能说明多人同时使用时仍能保持同样速度。
标题中的每秒 60 至 100 token 还启用了 MTP,并一次草拟 3 个 token。MTP 可以先猜测后续 token,再由模型确认,以减少逐个生成的等待。作者明确给出的对照是:关闭 MTP 后,解码速度为每秒 40 至 50 token。标题范围为何波动、各次测试的具体条件,帖子没有完整披露。
它为什么值得看
这套方案的价值不在于证明旧 AMD 卡已经全面取代新硬件,而在于展示了另一种本地推理思路:先用退役企业卡低价聚合显存,再用高度定制的软件追回性能。更有意思的是,一台准备被拆卖的大模型机器,靠另一个大模型协助修改底层内核,才获得继续服役的机会。
它也提醒我们,大显存机器的成本不能只看显卡单价。硬件兼容、软件适配、量化方式和投机解码都会改变最终体验。这里的性能来自整套特殊组合,而不是八张卡自然相加。
局限与未知
- 所有信息均来自同一篇 Reddit 用户自述,尚无代码、完整硬件清单和可复现实验记录。
- “2800 美元”是否覆盖整机并不清楚,当前二手卡价格也可能已经变化。
- 帖子正文只简称模型为 QFN,其正式名称和具体版本仍待核对;DeepSeek 与 GLM-5.3-Flash 只是后续适配计划,尚不能算作运行成果。