文 | 字母 AI
口口声声呼吁减速的阿莫迪,一脚踩满了油门。
2026 年 9 月 26 日,Anthropic 发布了 Sonnet 5.5。不仅性能接近 Opus 5.5,价格还只有 Opus 5.5 的一半。
在 Artificial Analysis 给出的智能水平评分榜上,Sonnet5.5 更是超越了 GPT-6 Astra 以及 Anthropic 自己的旗舰模型 Claude Fable 5.1。

所以,说好的减速呢?
为什么它这么强还这么便宜?
Sonnet 5.5 的性能非常强。其在 Terminal-Bench 4.0 的成绩为 70.6%,上代 Sonnet 5 只有 10.3%。
在 GDPval-AA v2.1 上,它拿到 1844 分,距离 Opus 5.5 的 1846 分只差 2 分。CursorBench 4.0 是 55.5% 对 57.8%,同样接近于 Opus 5.5。

Sonnet 5.5 更适合日常任务,比如修 bug、迭代功能,以及做文档、幻灯片和表格。
Sonnet 是 Claude 家族里的轻量模型,它的性能本应该和旗舰模型差很多才对,但为什么 Sonnet 5.5 会突然变得这么能干?
从公开材料看,最明显的变化不是它记住了更多知识,而是它把任务做完的能力强了。
Anthropic 从 Sonnet 5 开始,就强化了推理、工具使用和编程,做事时更愿意调用工具并检查结果。到了 5.5,提升集中体现在智能体编程、电脑操作和视觉理解这些需要连续行动的环节。
它在 OSWorld 2.1 上从上代的 57.0% 提升至 80.1%,在不使用工具的图表识别测试 Chartography 上从 15.6% 提升至 61.6%。
也就是说,Sonnet 5.5 已经掌握了从屏幕里收集信息,再据此推进任务。
拿修 bug 来说,读懂代码只是第一步,模型想要完成整个修 bug 的任务,它还得找到相关文件、判断改动会影响哪里、调用工具修改,再确认问题是否解决。
任何一步出错,整道题都可能失败。
这就是为什么 Sonnet 5.5 在 Terminal-Bench 上的得分能大幅提升,它不是那种简单的 " 代码智商 " 暴涨,是通过这种收集信息的能力,让模型能完成整个链条。

Anthropic 在发布 Opus 5.5 时,就明确说过它改进了写作与沟通方式,"You are right!" 最具代表,Fable 5.1 从来不会说这个口头禅,但是 Sonnet 5.5 也开始说这个口头禅了。
那它为什么便宜?先看标价:Sonnet 5.5 每百万输入、输出 token 分别是 2 美元和 10 美元,正好是 Opus 5.5 的一半。5 分钟缓存写入是 2.50 美元对 5 美元,缓存读取都是 0.20 美元。
所谓 5 分钟缓存写入,指的是通过 API 首次发送一段会重复使用的提示内容时,让系统把它缓存起来,这次写入,就是按 "5 分钟有缓存 " 档位来计费的。
同时,Anthropic 还表示 " 每项任务最高便宜 30%",来自完成同一件事通常消耗更少 token。用同一价格、少走一些弯路,账单自然会变薄。
还是以编程来举例。
早期测试者观察到,Sonnet 5.5 比 Sonnet 5 更倾向于把工具调用成批处理。这就使得整体步骤更少,进而更省 token。
Anthropic 称,在 FrontierCode 的 High 档位上,它比上代同档位高约 10%,单任务成本却约为后者的 15 分之 1。
在一些评测中,Sonnet 5.5 用 Low 或 Medium 档位,就能以大约十分之一的任务成本超过 Sonnet 5 的最好成绩。
便宜的关键不只在每个 token 卖多少钱,还在模型为完成任务究竟花掉多少 token、绕过多少次工具。
此外,Sonnet 5.5 的输出速度也比 Sonnet 5 提高了 30% 以上。
以下为 Sonnet 5.5 和 Sonnet 5 速度、性能对比。
模型之外还有什么?
比起性能,Anthropic 如今更注重工程方面的提升。
比如 Fable 5.1,它就引入过防止提取推理内容的 Preserved Thinking。如今,这套机制也进入了 Sonnet 5.5,并且向前走了一步。
Anthropic 为 Sonnet 5.5 加上防止推理提取的安全分类器,同时把它产生的思考块绑定到创建它的账户或关联账户。
换一个不关联的账户重放,API 会丢弃该思考块,模型看不到先前的推理。不过这套防护系统,普通开发者根本不用管这套防护系统,因为它并不影响你阅读整个思考过程,Anthropic 主要想防的是那些想大规模蒸馏、反复调用来抽取模型能力的企业。
思考块的签名还与此前的对话绑定。
如果开发者改动已经发生的系统提示、工具定义或历史消息,再把旧思考块塞回去,新账户默认可能收到 400 错误。
正常追加对话通常不受影响,但那些习惯在后台悄悄改写历史的智能体框架,就得重新处理会话。
安全护栏也从 " 要不要拒绝用户过分的请求呢?",变成了 " 我该把这个问题交给谁回答?"。
Sonnet 5.5 的网络安全能力提升,因此高风险网络安全请求可能触发分类器,并被明显地回退给 Sonnet 5。
正常找 bug 和修 bug 仍可使用 Sonnet 5.5。
Claude API 上的服务端自动回退目前处于测试阶段,需要开发者启用。
Sonnet 5.5 遇到某些被安全系统拦下的请求时,不一定直接结束;如果开发者开启了 " 自动回退 ",系统会尝试换成 Sonnet 5 来回答。