Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.087 — 2026-09-29
NEWS 2 信源 约 7 分钟

Sonnet 5.5:更快,也更省钱

Anthropic更新主力中端模型:生成快逾30%,单价未降,但厂商称完成任务最多省30%。

IMAGE — Anthropic (via Google News)
Sonnet 5.5:更快,也更省钱

让 AI 修改一套演示文稿,或自己查代码、调用工具、修复一个 bug,等待几秒和少等几秒,看起来区别不大。但如果企业每天要运行成千上万次,或者让模型连续执行几十步,速度和每一步消耗的 token 都会累积成时间与账单。Anthropic 新发布的 Claude Sonnet 5.5,瞄准的正是这笔日常开销。

Sonnet 5.5 是 Claude 5.5 系列的第二款模型。Anthropic 把它定位为主力中端型号:没有强调取代旗舰 Opus 5.5,而是主攻边界清楚的日常任务,例如修 bug,以及制作较完整的文档、幻灯片和电子表格。需要提前说明的是,速度、成本和多数能力数据来自 Anthropic 自测或其发布材料,TechCrunch 的报道也主要转述了厂商说法,尚不能视作独立验证。

“更省钱”不是降价

这次最容易误读的地方,是“最高节省 30%”。Sonnet 5.5 的 API 单价并没有下降:每百万输入 token 为 2 美元,每百万输出 token 为 10 美元,缓存读取为 0.20 美元,与 Sonnet 5 相同。

Token 可以理解为模型处理文字时使用的计量单位;输入问题和生成答案都会消耗 token。缓存读取则像翻看已经整理好的笔记,模型可以复用此前计算过的内容,不必从头处理。

Anthropic 所说的省钱,来自另一条路径:Sonnet 5.5 完成同一项工作通常使用更少 token。按其内部测试,单项任务成本最多可比 Sonnet 5 低 30%。这里的“最多”很重要。它不是所有调用统一打七折,也不代表账单必然下降三成。实际节省多少,要看任务类型、模型运行多久,以及需要调用多少次工具。

这对 Agentic deployment 尤其重要。所谓 Agentic deployment,是让模型持续调用工具、完成一连串步骤,而不只回答一次问题。比如查找文件、读代码、修改程序、运行测试,再根据报错继续修正。单步少花一点,在长流程里才会逐渐放大。

快,来自输出和步骤两头

Anthropic 称,Sonnet 5.5 的输出生成速度比 Sonnet 5 快 30% 以上,是目前速度最快的 Sonnet。早期测试者还观察到,它更常把多个工具调用合并处理,因此可能用更少步骤完成任务。不过,这部分同样来自厂商和早期测试反馈。

速度提升改变的不只是等待时间。对于需要反复修改文档、界面或代码的工作,反馈循环会更短:人提出要求,模型给出版本,人再调整方向。Anthropic 将它描述为适合快速迭代的工作伙伴,并称早期测试者认为它比 Sonnet 5 更自然、更善于协作。

Sonnet 这个名字原本就代表 Claude 产品线的中档:Haiku 偏轻量和低成本,Sonnet 面向主力通用任务,Opus 则承担更复杂、需要持续判断的工作。Anthropic 曾表示,2024 年的 Claude 3.5 Sonnet 已在多项自测中超过上一代 Opus,速度还是后者的两倍。Sonnet 因而逐渐不只是折中型号,而成为重要的日常工作模型。Sonnet 5.5 延续的正是这条路线。

一项成绩很亮眼,但不能概括全部

最醒目的数字来自 Terminal-Bench 4.0。这是一项 Agentic coding 评测,用来观察模型能否在终端环境中自主完成编程任务。Sonnet 5.5 得分 70.6%,Sonnet 5 只有 10.3%,Opus 5.5 则为 66.4%。

这个结果说明,Sonnet 5.5 在该项测试中不仅大幅领先前代,还略高于旗舰。但不能据此简单得出“中端全面超过旗舰”。在另外两项编程评测中,Opus 5.5 仍然领先:FrontierCode 1.1 的主要设置下,Sonnet 5.5 在 Max 档得分 46.2%,Opus 5.5 为 54.4%;CursorBench 4.0 中,两者分别为 55.5% 和 57.8%。Max 指模型采用更高的努力设置,通常会运行更久、消耗更多资源。

Terminal-Bench 从 10.3% 跃升到 70.6% 的幅度异常大。现有材料没有展开评测脚注,也不足以确认两代模型的运行配置是否完全可比。因此,这个数字值得关注,却不宜单独承担结论。

办公类任务呈现出更一致的定位。GDPval-AA v2.1 用来自多个职业和行业的现实任务衡量知识工作能力。Sonnet 5.5 得分 1844,几乎追平 Opus 5.5 的 1846,也高于 Sonnet 5 的 1449。Anthropic 还称,它在一次内部测试中根据上市公司的季度材料、电话会记录和幻灯片模板制作十页经营回顾,两名专家认为初稿可以直接发送。这是一个直观案例,但仍属于厂商内部测试。

另一个展示长流程和图像理解能力的例子更轻松:Sonnet 5.5 成为首个仅凭游戏截图完成并击败《Pokémon Red》的 Sonnet 模型。它说明模型能够从连续画面中判断状态并长期推进任务,但不等同于普遍的现实工作能力。

为什么这次更新值得看

我们在 9 月 23 日介绍过旗舰 Opus 5.5。Sonnet 5.5 补上了同代产品的主力档位,也把 Anthropic 的分工说得更清楚:Opus 负责复杂、开放、需要持续判断的任务;Sonnet 则争取用更快响应和更少 token 覆盖大量日常工作。

这种分工比单纯争夺最高评测分数更贴近企业选型。模型只要进入高频工作流,速度、每项任务成本和能力是否“够用”,往往要一起计算。Sonnet 5.5 的吸引力,不在于每项能力都超过 Opus,而在于部分任务已经接近旗舰,同时保留中端价格。

能力提高也带来新的安全安排。Anthropic 评估认为,Sonnet 5.5 的网络安全能力已与 Opus 5 相当,因此首次为 Sonnet 型号配置了面向高能力模型的网络安全防护和回退机制。厂商称,这些措施针对范围较窄的高风险请求,常规软件开发通常不受影响;其生物安全防护则与 Sonnet 5 相同。

接下来,面向高吞吐量和成本敏感场景的 Claude Haiku 5.5 计划在未来数周加入产品线,但 Anthropic 尚未给出明确日期。

局限与未知

  • “快 30% 以上”和“单任务最多省 30%”主要是 Anthropic 的测试结论,尚缺独立实测;后者来自 token 用量减少,并非 API 单价下调。
  • 各项编程评测结论并不一致。Sonnet 5.5 在 Terminal-Bench 4.0 超过 Opus 5.5,但在 FrontierCode 和 CursorBench 上仍落后,不能概括为全面胜过旗舰。
  • Anthropic 明确表示,基准测试只反映能力的一面;在复杂、开放且需要持续判断的工作中,其自测和外部测试者仍认为 Opus 5.5 更强。

供稿材料 SOURCES — 2

← 返回 2026-09-29 · 科技板块