Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.061 — 2026-09-03
NEWS 约 1 分钟

老款Radeon跑长上下文又快一步

专为 Radeon VII、MI50/60 优化的 llama.cpp 分支,长上下文预填充最高快约14%。

让本地 AI 先读完一大段材料再回答,等待往往发生在“开口”之前。这个阶段叫预填充(prefill)——模型要先处理整段输入,上下文越长,耗时越明显。一个面向 AMD gfx906 老显卡的 llama.cpp 分支,正试图缩短这段等待,让 Radeon VII、Instinct MI50 和 MI60 继续胜任本地大模型推理。

作者称,他们在 Qwen 3.8 27B 的生产配置中改用 DFlash2 后,发现部分旧优化没有收益,甚至拖慢速度,于是重写了小 Q 的 Flash Attention 路径。Flash Attention 是一种减少显存读写的长序列加速方法;新版还会自适应选择原生计算或格式转换。与当时的 llama.cpp 主线相比,首次批次预填充从 332.3 提升到 379.2 token/s,增幅 14.1%;填充 120k 上下文时从 231.1 提升到 252.6 token/s,增幅 9.3%。深层上下文生成则基本持平,为 13.6 对 13.5 token/s。作者还称,两者输出逐字节一致。上述结果来自项目作者自测,材料未披露更多硬件与完整测试条件。


供稿材料 SOURCES — 1

← 返回 2026-09-03 · 开源板块