你有一辆旧卡车,发动机还能转,麻烦却是新公路不再给它留入口。NVIDIA V100 的处境有些相似:硬件仍能计算,但现代大模型服务软件的优化重点已经转向更新架构。1Cat-vLLM 想做的,就是给这批退役数据中心卡补回入口,让它们继续承担本地 AI 推理。值得注意的是,目前“追上现代推理”的说法仍缺少同条件独立测试;下文性能数字来自项目仓库,硬件对比则来自一篇 Reddit 用户帖。
旧卡缺的不是算力开关
vLLM 是一种大语言模型服务引擎,负责安排请求、管理显存并连续生成文字。1Cat-vLLM 是它面向 NVIDIA Volta 架构的工程分支;V100 是 2017 年推出的代表性 Volta 数据中心卡,SM70 则是软件识别这代硬件能力时使用的代号。
据 1Cat-vLLM GitHub 仓库,项目目标不只是让现代模型在 V100 上成功启动,而是让它达到可用的服务性能。发布说明称,它补入了 V100 专用的 FlashAttention 扩展——一种加速模型处理上下文的实现,以及适配 SM70 的量化和混合专家执行路径。量化是用更低位数保存或计算模型权重,借此减少显存与运算量;关键不只是把模型压小,还要让旧卡能高效执行这种格式。
这像是为仍能工作的老机器重写操作手册。项目作者的判断是,V100 的 Tensor Core 并未突然失效,只是主流软件栈不再认真优化它。
数字不错,但不能混着比
项目仓库公布的匹配测试显示,4 张 V100 运行 Qwen3.6-35B-A3B NVFP4 时,不启用 MTP 的解码速度为 116.99 token/s,启用 MTP4 后为 174.76 token/s。token 是模型处理文字时使用的小片段;token/s 越高,通常表示连续生成越快。项目还报告,4 张 16GB V100 运行 Qwen3.8-27B-NVFP4 与 DFlash2 时约为 260 token/s,同时明确提醒:这是一次特定真机演示的标题数字,不是所有负载都能保持的固定速度。
Reddit 供稿者还比较了运行高度优化 llama.cpp 分支的 Strix Halo 与运行 1Cat-vLLM 的 V100,使用的模型被写作 Qwen3.6-35b。但供稿没有给出所谓 llama-benchy 原始数字,也没有交代量化方式、上下文长度、批量、V100 型号和数量。发帖者本人也承认,这不是“苹果对苹果”的比较:两边硬件、推理后端和优化实现均不同。因此,它只能说明旧 V100 可能仍有实用价值,不能证明它已经追平 Strix Halo,更不能把差异单独归功于 1Cat-vLLM。
真正诱人的是存量价值
这项工作的意义不在于宣布旧卡战胜新卡,而在于重新评估已经存在的硬件。张量并行(TP)可以把同一模型的矩阵计算拆到多张 GPU 上,让较大模型装得下或跑得更快;代价是卡间通信会吃掉一部分收益。对手里已有 V100 的团队而言,如果软件优化能把闲置设备变成可用的模型服务器,部署账本就可能发生变化。
不过,“卡便宜”不等于“系统便宜”。据 Tom's Hardware 报道,一名玩家用约 266 美元购入 V100 和转接板,却先遇到约 82 分贝的散热噪声,后来才通过改接风扇控制解决。旧卡本地部署还要处理转接、供电、驱动和散热,这些都是真实成本。
局限与未知
- 尚无项目方之外的独立复测,不能确认仓库数字的可重复性。
- 各项公开测试使用不同模型、上下文、批量、量化格式和推测解码设置,不能直接横向排名。
- 发布说明提醒,首次真实请求可能包含内核编译、CUDA Graph 捕获和预热延迟;稳定速度应在预热后测量。