Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.097 — 2026-10-09
REPO 3 信源 约 7 分钟

Haiku 5.5:小模型接管高频Agent

Haiku 5.5用百万上下文和低价瞄准子Agent:重点不是最强,而是让自动化跑得起。

IMAGE — Claude Code Releases
Haiku 5.5:小模型接管高频 Agent

你让一个 AI 助手检查代码、查网页、整理资料。它每完成一步,都要重新读任务、判断结果、决定下一步。真正烧钱的往往不是某次回答,而是这一连串高频调用。Anthropic 新发布的 Claude Haiku 5.5,瞄准的正是这类工作:它不争夺“单次回答最强”,而是想成为便宜、快速、可以反复派活的执行者。

这里的 Agent,是能围绕目标连续调用工具、观察结果并调整行动的 AI 程序。子 Agent 则像主 Agent 临时叫来的助手,分别搜索资料、检查代码或处理网页。Anthropic 把 Haiku 5.5 明确推向 summarization(摘要)、subagents(子 Agent)和 browser use(浏览器操作)等高吞吐、成本敏感型任务。不过,“小模型接管高频 Agent”目前仍是产品方向,而不是已经得到采用数据证明的趋势。本文的能力与价格信息主要来自 Anthropic 发布记录和 OpenRouter 页面,尚缺独立评测。

便宜,才有资格被反复调用

Haiku 5.5 已接替 Claude Haiku 4.5。Anthropic 的发布记录还称,它现在是 Anthropic API 默认的 Haiku 模型。API 是软件调用模型的标准接口;“默认”意味着开发者选择 Haiku 档时,会更自然地用到这一代模型。

它最醒目的数字是价格。OpenRouter 标准路由页面列出的报价为:每百万输入 token 0.10 美元,每百万输出 token 0.50 美元。token 是模型处理文字时切分出的基本单位,不完全等同于字或单词。批处理版本更低,分别为 0.05 和 0.25 美元,但 batch 是把任务攒起来集中处理,不能和需要立即响应的实时调用混为一谈。

价格也不是任何情况下都固定不变。Anthropic 的发布记录注明,当 prompt——也就是发给模型的输入——超过 10 万 token,输入和输出价格会上升到每百万 token 0.50 和 2.50 美元。换句话说,Haiku 5.5 的低价优势最适合大量常规调用;一旦每次都塞入超长材料,账单结构会明显变化。

这对 Agent 很关键。一个主 Agent 可以把十几个局部任务交给子 Agent。如果每个子任务都调用昂贵模型,自动化流程很快会失去经济性。小模型只要“足够好”,便宜本身就是一种系统能力:它让更多检查、重试和并行处理成为可能。

百万上下文,给执行者一张更大的桌子

Haiku 5.5 支持 100 万 token 的上下文窗口,并接受文字和图片输入。上下文窗口,是模型一次能够读取和参考的信息总量,可以理解成工作桌面的大小。桌面越大,越有机会同时摆下长文档、代码片段和此前的操作记录。

这不等于模型一定能准确使用窗口里的每一处信息,现有材料也没有提供长上下文测试。但对浏览器自动化和子 Agent 来说,容量本身很实用:执行者可以携带更长的任务说明、页面内容与操作历史,不必过早压缩或丢弃前文。

这也是 Haiku 5.5 与“便宜小模型”旧印象拉开距离的地方。小模型过去常被看作一次只办一件简单差事;百万上下文则让它有机会接住更长的工作链。代价是,超过 10 万 token 后会进入更高价格区间。大桌子可以备用,但不应默认把桌面堆满。

它可以自己决定想多久

OpenRouter 的 Anthropic 模型说明称,Haiku 5.5 是首个支持 adjustable effort 的 Haiku。这个功能允许应用在思考深度、响应延迟和成本之间调节:adaptive thinking 默认开启;在 low、medium、high 三档 effort 下,也可以关闭思考。

说白了,同一个执行者不必用同样力气处理所有任务。整理页面标题可以少想一点,检查代码或规划多步操作则可以提高 effort。对于高频 Agent,这种调节比单纯追求最高能力更重要,因为任务难度并不均匀。系统可以把计算花在真正需要的步骤上。

OpenRouter 还称,新模型比 Haiku 4.5 有更强的 coding、computer use 和 knowledge work 能力,也就是更擅长编码、操作电脑和处理知识工作。但页面没有给出基准测试、对照条件或第三方评测,这更接近厂商定位,暂时不能当作已经证实的性能跃升。

为什么值得现在看?

Haiku 5.5 展示了一种清晰的 Agent 分工:强模型负责理解目标、规划和处理棘手判断;小模型负责查找、整理、检查和重复操作。后者单次未必耀眼,却可能承担系统里数量最多的调用。

“Haiku”本来就带有短小、凝练的文学联想。TechRadar 此前在 Haiku 4.5 发布时,已用这种定位解释它为何适合充当大模型身边的子 Agent;到了 Haiku 5.5,Anthropic 又把 subagents 直接列为主要用途之一。这条路线正在从形象比喻变成具体的产品配置。

据美联社援引 Anthropic 此前披露的数据,Claude 已主导公司约 26% 的模型研发工作,并参与约 90% 的研发活动。Anthropic 同时强调,这些工作并非完全自主。放在这个背景下,Haiku 5.5 很像 AI 团队里的高频执行层:处理上下文压缩、资料查找和重复操作,把更昂贵的能力留给难题。

真正值得观察的因此不是某个跑分,而是成本结构是否会改变 Agent 的设计。只要一次任务需要几十次甚至更多模型调用,“每次便宜一点”就会在整个流程中被放大。百万上下文、可调思考强度和面向浏览器操作的定位,都是在为这种持续运行服务。

局限与未知

  • 目前没有公开材料证明 Haiku 5.5 已经“接管”高频 Agent,也没有实际采用规模、任务成功率或完整成本数据。
  • “更强的编码、电脑操作和知识工作能力”来自模型页面描述,缺少基准测试与第三方评测。
  • OpenRouter 页面曾展示最低约 0.33 秒的首 token 延迟和最高约 177 tps 的端点观测值,但相关端点不用于标准路由,测试方法与稳定性也未披露,因此不能代表普通用户稳定可得的速度。

供稿材料 SOURCES — 3
01
v2.1.293 Claude Code Releases · NEWS
原文 ↗
02
Anthropic: Claude Haiku 5.5 OpenRouter 新模型上架 · REPO
原文 ↗
03
Anthropic: Claude Haiku 5.5 (batch) OpenRouter 新模型上架 · REPO
原文 ↗

← 返回 2026-10-09 · 开源板块