Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.060 — 2026-09-02
NEWS 约 1 分钟

单卡投机解码再提速

DSpark让单张GPU先批量“打草稿”再核验,以额外显存换取更快生成。

IMAGE — KDnuggets

让本地 AI 一次只写一个词,速度常卡在反复等待上。DSpark 的办法像先快速打出一小段草稿,再交给主模型成批核对:这叫投机解码,核验机制保证最终输出仍遵循主模型的解码规则。它值得关注,因为目标不是增加 GPU,而是让同一张卡生成得更快。

DSpark 的关键在“既并行,又照顾前文”。纯并行起草能一次猜出一批 token——模型处理文字的基本单位——但后面的猜测未必充分参考前面刚猜的内容。DSpark 加入轻量的顺序处理,让后续候选利用较早的预测;它还能估计候选通过核验的可能性,提前丢掉低置信度部分,减少无效计算。

KDnuggets 的示例用 CUDA 加速的 llama.cpp 运行 Qwen3-8B:主模型文件约 4.7GB,配套 DSpark 起草模型约 1.2GB。这个数字也点明了代价——提速并非免费,起草模型会额外占用显存和算力。DeepSeek 自述其在 DeepSeek-V4 上相对旧版 MTP-1 基线将单用户生成速度提高 60%至85%,但材料没有给出这套 Qwen3-8B 单卡测试的实际吞吐结果,因此不能把该幅度直接套到本地部署。


供稿材料 SOURCES — 1

← 返回 2026-09-02 · 数据板块