Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.078 — 2026-09-20
NEWS 约 5 分钟

Inco Splash让Mac推理再快一档

为苹果芯片定制的本地推理引擎,亮点不只快,更在多 Agent 并发。

IMAGE — r/LocalLLaMA 日榜

你让一个编程 Agent 同时检查代码、补测试、查文档,它往往会再派出几个子 Agent。此时,决定体验的已不只是单个回答有多快,而是几路任务能否一起顺畅生成。Inco Splash 瞄准的正是这个场景:它是一款针对 Apple Silicon 和特定模型定制的本地推理引擎,并宣称能让 Mac 上的大模型推理明显提速。不过,目前主要性能数字来自项目方和一篇 Reddit 帖子,尚缺独立测试。

它为什么能更快?

推理引擎可以理解为模型与硬件之间的“调度员”:它负责加载模型、安排计算,再让模型逐个生成 token——也就是文字被切分后的基本单位。

Splash 没有追求支持尽可能多的模型。按 Inco AI 的说法,它会为每个模型单独设计计算内核、内存方案,并配备一个小型 draft model——先猜测接下来可能出现的 token,再由大模型核验。这种路线像为固定车型单独调校发动机,适用范围较窄,但有机会把硬件性能榨得更充分。首发阶段因此只支持两个模型。

这种选择尤其贴合 Apple Silicon。苹果芯片让 CPU 与 GPU 共用统一内存,减少数据来回复制,也能把更多机器内存用于模型权重;但要真正利用这些条件,推理引擎仍需针对芯片和计算接口做适配。Inco 还称,团队让内部的 kernel agents 自动生成和调优底层计算代码。

144 token/s,要怎么看?

Reddit 帖子称,Qwen3.8-27B 在 M5 Max MacBook Pro 上可达到 144 token/s;Splash 的解码速度最高为 Ollama 的 3 倍、oMLX 的 2 倍。这里的“最高”很重要:材料没有给出量化精度、上下文长度、批大小、软件版本、功耗或首词延迟,因而不能把这些峰值写成日常使用中的稳定表现。

项目方正式发布页提供了另一组更容易理解口径的数字:同一模型在配备 48GB 内存的 M5 Pro 上,单请求、短提示的解码速度是 74 token/s;四个子 Agent 同时运行时,总吞吐达到 170 token/s。前者是“一路对话跑多快”,后者是“四路任务合计产出多少”,两者不能直接混用。Reddit 所称的 144 token/s 来自不同芯片,但目前没有正文实验数据说明其具体测试方式。

Splash 更值得注意的地方,可能恰恰是并发。Reddit 帖子称,当主 Agent 分出多个子 Agent 时,速度提升接近 4 倍。对于编程 Agent,总吞吐——系统同时处理多条生成任务的能力——往往比单路峰值更有意义。不过,该说法没有披露并发数量和比较口径,也可能衡量的是合计吞吐,而非每条请求都变快近 4 倍。

它瞄准的是长时间工作的 Agent

据 Inco AI 公布的数据,Splash 首次读取 32K 上下文仍需约 96 秒;但缓存命中后,下一轮首个 token 只需 282 毫秒。上下文是模型当前携带的代码、对话和指令;缓存则保存已经算过的中间结果,避免下一轮从头处理。换句话说,它未必让第一次读完整个大型项目变得轻松,却可能让反复携带同一份代码继续工作的 Agent 响应更快。

Reddit 帖子称,Splash 要求 M3 或更新芯片、macOS 26.4 以上及至少 36GB 内存,可通过 Homebrew 安装,并用 splash serve --model incoai/Qwen3.8-27B-Splash 启动。它还宣称可供 Claude Code、OpenCode、Codex 和 Hermes 调用,并已作为运行时进入 LM Studio Bionic。

局限与未知

  • 所有关键性能论断仍来自项目方或转述项目方信息的单一 Reddit 帖子,缺少独立复测。
  • Qwen3.8-27B-Splash 的具体改造方式、开源许可证和测试配置尚未在供稿中披露。
  • 安装命令、系统与内存要求,以及 LM Studio Bionic 集成是否已全面公开可用,仍需进一步核验。

Splash 展示的方向比某个峰值数字更重要:它不做万能引擎,而是围绕少数模型、苹果芯片和多 Agent 工作流进行专门优化。144 token/s 目前更适合作为待验证的性能主张;多路并发与缓存复用,才是这条路线真正值得继续观察的部分。


供稿材料 SOURCES — 1

← 返回 2026-09-20 · 开源板块