Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.093 — 2026-10-05
NEWS 5 信源 约 6 分钟

专用推理引擎,开始围攻通用栈

Kyojin、gufo 等专用引擎贴着模型和硬件调校,正以牺牲兼容性换取本地推理性能。

IMAGE — r/LocalLLaMA 日榜

一台小主机,也想装下超大模型

买一台配有 128 GB 内存的迷你主机,然后让它运行约 300B、也就是约三千亿参数级别的大模型,听起来像把一支搬家车队塞进家用车库。Kyojin 做的正是这件事:它把两款 MoE(混合专家)模型分别压进一台 Ryzen AI Max+ 395 机器。这里的“分别”很重要,不是两款同时运行,而是每款都能单独装下。

这批项目值得关注,不只因为数字快。它们反映出本地 AI 软件的一次路线分化。推理运行时——负责加载模型、安排 CPU/GPU 计算并生成回答的软件层——过去常把广泛兼容放在首位。现在,一批新项目主动缩小目标:只服务少数模型,甚至只认一种硬件,以此把机器的潜力榨得更彻底。

目前较可靠的结论是,这类专用引擎确实正在成群出现,且硬件绑定非常明显。至于具体速度,绝大多数仍来自项目方或单个用户自测,尚不能视为同条件下的独立横评。

Kyojin:先让三千亿参数装得下

Kyojin 建在 ExLlamaV3 之上,专门面向 AMD Strix Halo 的 gfx1151 图形架构和 ROCm 软件栈。项目作者称,量化后的 GLM-5.3-Flash 和 MiMo-V2.6-Flash-MOPD 分别占用 99.7 GB、105 GB,因此都能放进一台配有 128 GB 内存的 Ryzen AI Max+ 395。

这里的关键条件是统一内存:CPU 和集成 GPU 共用同一片物理内存,不必把数据频繁搬过两套内存。更重要的是,128 GB 的容量可以容纳普通独立显卡显存放不下的模型。

装下只是第一步。项目方测得,GLM-5.3-Flash 在约 3,500 token 输入下的预填充速度约为 580 tok/s,输入拉到 64K 时仍为 546 tok/s;采用 MTP 模式生成时为 26—30 tok/s。MiMo-V2.6-Flash 在 4K 输入下预填充约 650 tok/s,普通生成约 29 tok/s;代码场景中的 speculative 峰值为 44 tok/s,不能把这个峰值与普通生成混为一谈。

预填充(prefill)是模型先读完整段输入,生成(decode)则是随后逐个 token 写出答案。两阶段的瓶颈不同,所以“每秒读多少”和“每秒写多少”不是同一种成绩。

压缩模型也会带来质量问题。Kyojin 作者用官方 FP8 输出作参照,报告两款量化模型的 Top-1 agreement——每一步最可能输出是否一致——分别为 89.3% 和 92.0%。这说明项目并非只测速度,但它没有提供完整任务集成绩;转换流水线也保持私有。

gufo:把“只为这一台机器”写进原则

gufo 走得更极端。它围绕 Ryzen AI MAX+ 395、Radeon 8060S(gfx1151)和最高 128 GiB 统一内存做垂直优化。项目明确只支持这套硬件能运行的少数模型,还拒绝为了复用而让不同模型共享计算内核,以限制一次改动可能影响的范围。

这就是所谓“过拟合”推理引擎。这里借用了机器学习里的说法,指软件做出极窄的工程取舍,并不是说模型训练出了问题。通用运行时像能走多种路况的量产车;gufo 更像按一条赛道调校的车,换条赛道就未必能开。

项目方报告,Qwen3.6 35B-A3B Q6dense 的预填充峰值为 3,095.44 tok/s,MTP 单用户生成最高 190.67 tok/s;Qwen3.8 Flash-Next 则分别达到 1,628.52 tok/s 和 59.41 tok/s。gufo 也报告了八路并发数字,但那是各请求速率相加,不能当作单个用户实际看到的生成速度。项目还明确说明,这些是峰值工作负载,部分峰值包含重复输出。

专用优化也开始向原目标之外扩散。非官方 Windows 移植已经提供预编译包,但仍只支持 gfx1151。移植者自报,Qwen3.8 Flash-Next 在 agentic、高上下文负载下平均约 40 tok/s。这个数字低于项目方的 59.41 tok/s 峰值并不矛盾:测试环境和负载不同。不过移植者称代码由“vibecoded”方式完成,虽然做了逐次输出一致性检查,稳定性与安全审计仍缺少充分证据。

通用栈不会消失

Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 和 Kyojin 的相继出现,说明“按模型和硬件贴身定做”已经不只是一个孤例。我们此前介绍过 Strata 如何让系统内存与显存共同承载模型。又有用户在 3 张 RTX 3060 12GB、IQ3 配置上自报,Strata 运行 Flash-Next 达到 38—40 tok/s,而 llama.cpp 为 13.2 tok/s。

但这组结果只来自一台旧矿机配置,没有控制版本、参数、输出质量和功耗,不能据此宣布 Strata 普遍快三倍。它更像一个方向提示:当软件知道自己只需要服务哪款模型、哪组显卡时,确实可能找到通用引擎不愿采用的激进捷径。

更可能出现的不是专用栈取代通用栈,而是两者并存。通用引擎负责让更多模型先跑起来;专用引擎则在热门模型和固定硬件上继续压榨性能。不过,这仍是基于现有项目形态的判断,不是已经得到验证的行业结局。

局限与未知

  • Kyojin 尚未公布完整任务集、128K 上下文和非 gfx1151 GPU 的测试,其模型转换流水线也未开放。
  • gufo 的成绩是项目方报告的峰值,不同模型、量化精度、输入长度和 MTP 等模式差异很大,不能横向排成简单速度榜。
  • Strata 与 Windows gufo 的相关数字来自单个用户自报,仍缺少相同条件下的独立复测。

供稿材料 SOURCES — 5

← 返回 2026-10-05 · 开源板块