Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.075 — 2026-09-17
NEWS 约 1 分钟

JVM之外,苹果芯片也在加速DeepSeek

社区优化让DeepSeek V4.1F在M3 Ultra上突破40 token/s,并显出原生MTP的潜力。

IMAGE — r/LocalLLaMA 日榜

在高配 Mac 上跑超大模型,难点不只是不够快,还在于大量零碎计算会让硬件“等活干”。一位社区开发者针对 Apple Silicon 的统一内存架构——CPU、GPU 共享同一片内存——改写了 DeepSeek V4.1F 的本地推理流程,目标是减少这些调度开销。

据作者在 Reddit 自述,同一台 M3 Ultra、同一套 Q4 量化权重下,8k 上下文的生成速度从每秒 16.6 个 token 提升到 31.3 个;在 300k 长上下文下,也从 14.0 提升到 28.3。token/s 是每秒生成的文本单元数。再启用原生 DSpark MTP——让模型一次尝试预测多个 token,再进行验证——代码任务从 32.1 升至 40.5 token/s,Agent 回答阶段达到 41.3 token/s。作者还称,贪心解码时输出与上游版本逐字节一致。

最值得注意的不是单个跑分,而是优化方向:把每个 token 所需的大量小任务合并,减少硬件调度损耗,并压缩长上下文中的筛选工作。不过这仍是作者在特定 Mac、量化方式和任务上的社区测试,速度不能直接外推到其他配置。


供稿材料 SOURCES — 1

← 返回 2026-09-17 · 开源板块