Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.099 — 2026-10-11
NEWS 约 5 分钟

Basalt:双消费卡跑出665 tok/s

Basalt 用 5090+5060 Ti 跑出 665 tok/s,但这是特定负载下的项目方成绩。

IMAGE — r/LocalLLaMA 日榜

你在家里跑大模型,常见的烦恼不是模型不能回答,而是回答得太慢。加一张显卡看似能提速,却像让两个人合搬家具:如果分工和交接安排不好,第二个人未必帮得上忙。Basalt 想解决的正是这件事。它是 Strata 的一个开源分支,专门为 NVIDIA Blackwell 架构和 Qwen3.8 Flash-Next 模型调校,重点服务一张或两张消费级显卡。

这次最醒目的数字是 665 tok/s,也就是每秒生成 665 个 token——token 是模型处理文字时使用的基本单位。但这个成绩只对应作者所称的 structured 负载,不能当成通用生成速度;同一套双卡配置处理 prose,也就是普通文章式文本时,成绩是 354 tok/s。以下性能数据均来自项目作者的一篇 Reddit 自述,目前没有第三方复测。

两张卡,实际多快?

作者使用 GeForce RTX 5090+RTX 5060 Ti、Ryzen 9 9950X、32GB DDR5 内存,在约 400 W、IQ3_XXS 权重下测得上述成绩。IQ3_XXS 是项目支持的一种权重版本,选择不同版本会影响显存、内存和速度。

作为对照,单张 RTX 5090 达到 585 tok/s structured、316 tok/s prose。加入 RTX 5060 Ti 后,作者概括为“约快 12%”。其中 prose 的提升确实约为 12.0%,structured 则约为 13.7%。这说明第二张卡带来了增益,但远不是把速度翻倍。双卡推理需要把计算或数据分给两块 GPU,卡间传输和调度本身也有成本。

作者还称,Basalt 在相同权重上的吞吐量最高可达 Strata 的 2.6 倍。不过“最高”是峰值口径,材料没有给出完整的对照条件。它也不能外推到并发场景,因为作者明确表示没有 Strata 的 8-stream 数据。

读输入和写答案,是两种速度

Basalt 在 64k 上下文下报告了 7,317 tok/s 的 prefill 吞吐量。Prefill 是模型先读完输入;decode 才是随后逐个 token 写出回答。两阶段做的事不同,所以 7,317 tok/s 不能与 665 tok/s 直接比较,也不代表回答能以同样速度生成。

值得注意的是,单卡与双卡的 prefill 成绩不变。就作者数据看,第二张卡主要改善了输出阶段,而不是读取长输入的阶段。

Basalt 还支持最多 8 个并发用户。作者报告 8 streams 时总吞吐量为 623 tok/s。这里的“总”很关键:它是八路合计,不是每一路都能达到 623 tok/s。项目同时提供 shared KV、per-slot KV 和 MTP 等选项,但供稿没有披露这些功能各自贡献了多少提速。

它为什么值得看?

我们此前介绍 Strata 时,关注的是系统内存与 GPU 如何协同运行大模型。Basalt 又往前走了一步:它缩小适配范围,只服务 Blackwell 和 Qwen3.8 Flash-Next,以换取更激进的专用优化。这更像一辆按固定赛道调校的赛车,而不是适配各种道路的家用车。

项目会把权重重新打包成单个 .basalt 文件,而不是重新量化,并把 metadata、vision 和 MTP 一并装进去。首批支持 Q2、IQ3_XXS、IQ3_S、UD-Q4_K_XL 和 Q8 等版本。作者称 IQ3_S 在其测试中约有 89% top-1 agreement,双卡 prose 约为 300 tok/s;但这个 agreement 指标不等于通用模型质量,也不是完整 benchmark 得分。

此外,作者称自研视觉编码器在 GPU 上最高比 llama.cpp 快 3 倍,在 CPU 上最高快 4 倍。Basalt 采用 MIT license,提供 OpenAI 与 Anthropic 兼容接口,目前只支持 Linux,不支持 Windows 或 macOS。

局限与未知

  • 所有成绩都来自同一位项目作者,仓库和权重页面仍属于同一项目方,尚无独立复测。
  • 材料没有公开原始 benchmark 日志、测试命令、提示词、输出长度、采样参数和完整并发设置,别人难以做严格的同条件复赛。
  • 665 tok/s 依赖特定模型、量化版本、硬件和 structured 负载。它展示了高度特化优化的潜力,不代表其他模型、显卡或日常任务也能获得同样速度。

供稿材料 SOURCES — 1

← 返回 2026-10-11 · 开源板块