你问 AI 一个并不复杂的问题,它却像拿着草稿纸来回验算:重复几条思路,绕一大圈才交答案。这样的“过度思考”会消耗更多推理 Token——模型形成答案时使用的中间计算单位——让人等得更久,也增加计算费用,却未必提高正确率。
UkisAI 发布的 Swift 系列,想做的就是让模型少绕圈。值得注意的不是一句“更快”,而是现在既有官方数据,也有独立横向评测,可以看到篇幅、速度和准确率之间更真实的取舍。以下数字主要来自 UkisAI 自测和 Reddit 评测者 returnity 的两轮 Aider 编程测试,两者使用的模型版本、任务集和指标口径不同,不能直接拼成同一项结论。
不是催它快答,而是训练它别绕路
Swift 是一组基于 Qwen 的高效推理模型,包括 Swift1.5 27B、Swift Flash Next,以及仍标为实验性的 Swift Bonsai 2。
据 UkisAI 介绍,训练会惩罚与病态过度思考有关的 Token,再用强化学习——通过奖励信号调整模型行为——以及 GSPO、OPD 恢复准确率。供稿没有进一步解释后两种方法的具体设置。直观地说,这不是简单限制答题字数,而是先压制反复和绕圈,再尽量把因此损失的答题能力补回来。
官方五次运行的平均结果显示,Swift1.5 27B 比基础模型少用 58.5% 的 thinking tokens,得分高 0.35%;Swift Flash Next 少用 63.4%,准确率低 0.2%,速度约为 1.8 倍;Swift Bonsai 2 少用 39.8%,得分高 0.19%。这些测试覆盖 GPQA、AIME26、LiveCodeBench、ERQA 和 Terminal Bench 2.1,但目前仍是发布方单一信源。
Terminal Bench 2.1 还有一个容易误读的细节。UkisAI 称,Swift1.5 27B 不容易陷入“想太多而失败”的循环,因此会把更多任务继续做完,表面上的平均 Token 用量反而被拉高;按同口径比较,Token 降幅为 38.7%,成绩则优于基础模型。
民间复核:真正省下的是篇幅和时间
发布后,评测者 returnity 把 Swift-Qwen3.8-27B、原版 Qwen3.8-27B 和定位相近的 ThinkingCap 放进同一套 Aider 编程测试,各跑两轮。
Swift 的答案中位数为 7301 个 completion tokens,原版为 12547 个,少约 41.8%;每例耗时从 1481 秒降至 750 秒,约快 1.97 倍。这里测的是旧版 Swift-Qwen3.8-27B 的完整输出 Token,不能拿来直接验证 Flash Next 的 63.4% thinking tokens,但它至少独立支持了“少写约四成、耗时近乎减半”这个方向。
准确率没有出现同样大的变化。Swift 首次通过率为 30.8%,原版为 27.1%;重试通过率分别是 75.7% 和 77.6%。评测者认为差异大致处于误差范围内,不过这个判断只建立在两轮测试及其估计的误差上,并非严格统计结论。
为什么值得关注
推理模型的效率问题,不只是回答看起来啰嗦。Token 越多,等待和计算成本通常越高。Swift 展示了一条直接路线:不先换更小的模型,而是训练现有模型减少无效思考。
更重要的是,横向评测把代价摆到了桌面上。模型可以显著缩短输出并接近翻倍提速,但“少想”不自动等于“判断更稳”。另一项经编辑部核验的民间测试还发现,Swift 与原版知识正确率近似,却更少选择坦承“不知道”:原版放弃而 Swift 答错的题有 106 道,反向只有 55 道,差异不像随机噪声。它可能没有明显变笨,却可能变得更爱猜。
局限与未知
- 标题中的“少想六成”和“快近一倍”来自不同版本、不同测试,不能视为同一模型的一组独立实测结果。
- 新版本的精确降幅、训练方法、35 万次以上下载量,以及 GGUF、NVFP4、MLX、W4A16 等量化版本,均只有 UkisAI 官方信源。
- 现有独立 Aider 评测只有两轮;它能说明趋势,尚不足以证明所有任务都能稳定保持准确率与校准能力。