关于ZAKER Skills 合作
钛媒体 1小时前

Claude 把“回忆”砍到 2 毛 5,OpenAI 的万亿参数正在失去护城河

当 Ramp 的工程师在监控屏上看到那条 38 小时无人值守的机器学习任务曲线平稳收尾时,他们第一次觉得,让 AI" 睡着觉干活 " 这件事终于不再是实验室里的行为艺术。

支撑这场 " 睡眠实验 " 的,不是 OpenAI 那套越打越便宜的算力组合拳,而是 Anthropic 悄悄改动的一个小数点——缓存读取价从每百万 token 1 美元跌到 0.25 美元,一刀砍掉 75%。

2026 年 9 月,当所有人都在盯着 Claude Fable 5.1 那翻倍的 benchmark 分数时,真正让华尔街量化基金和硅谷极客彻夜难眠的,恰恰是这张价格表上最不起眼的一行字。同一套底层模型被拆成两条发布轨道,Fable 5.1 面向公众与企业全量开放,Mythos 5.1 只对经审核的网络安全与生命科学伙伴放行。输入输出价格分文未动,缓存读取价却打到了脚踝斩。

这一刀的位置,才是整场发布真正的题眼,也是 Anthropic 对整个 AI 行业下的一份战书。

OpenAI 在卷 " 智商税 ",Anthropic 在卷 " 租金 "

长久以来,AI 模型的定价叙事围绕 " 单次智能 " 展开——输入多少钱、输出多少钱,比拼的是谁的单价比谁低。OpenAI 在 2026 年 6 月推出 GPT-5.6 家族,把旗舰 Sol 定在 5 美元输入、30 美元输出,随后在 7 月把 Luna 砍价 80%,8 月再给 Sol 降超两成,一路把 " 每单位智能 " 的价格往死里压。

Anthropic 却反其道而行。它没有动那根最显眼的输入输出价签,而是把降价火力集中在一个更隐蔽、却更决定 Agent 经济命脉的地方——缓存读取。

先看几组数字。Claude Fable 5.1 的输入价仍为每百万 token 10 美元,输出价 50 美元,与上一代完全持平,普通输入甚至是自家 Opus 5 的两倍。表面上看,它更贵了。但缓存读取价从 1 美元跌到 0.25 美元,降幅 75%,而这个 0.25 美元只相当于 Fable 正常输入价的 2.5%,远低于其他 Claude 模型普遍采用的 10% 折扣系数。

这是整篇文章最反直觉的一个逻辑:Anthropic 在对 " 新想法 " 收最贵的税,却在对 " 旧回忆 " 做最狠的补贴。

传统上,我们习惯把模型成本等同于 " 吞吐 ",输入和输出像水流过水表,流多少付多少。但长时域 Agent 的成本曲线是另一条形状。它在一个项目上跑几小时、几十小时,每一步都在往同一个上下文里叠加状态,而这些状态里真正新产生的 token 只占很小一部分,绝大多数是反复读取的、已经算过一遍的旧信息。缓存读取,就是为这种 " 重复记忆 " 单独开的价。

Anthropic 官方给出的账本是:典型任务整体成本下降约 25%,高度 Agent 化的任务最高下降约 45%。这个数字的分母和分子都在指向同一件事——当一个 Agent 不再是一次问答,而是反复回到同一套代码库、同一批工具定义、同一段不断累积的对话历史时,成本的大头早已不是 " 生成一个新 token",而是 " 把已经处理过的上下文再读一遍 "。

这就好比一家航空公司,头等舱票价涨到天价,但 " 燃油费 " 突然打 0.25 折。因为 Anthropic 赌的是,未来的 AI 不是坐一次就下飞机的过客,而是包机飞越太平洋的常驻机长。对于机长而言,占大头的永远不是起飞那一下的推力,而是平流层里持续几十个小时的巡航油耗。

当 OpenAI 用 Luna 的 80% 降价、Sol 的两成让利去争夺 " 单次智能 " 的性价比高地时,Anthropic 把赌注押在了另一个变量上。它赌的是,Agent 的下一阶段不是 " 更快地答对一道题 ",而是 " 连续几十小时不跑偏地做完一件事 ",而在那个世界里,决定账单的不是模型有多聪明,而是模型记东西、读旧东西有多便宜。

比 " 答对 " 更重要的,是 " 不跑偏 "

降价之外,Fable 5.1 的能力跃升同样值得拆开看。

最显眼的一行是 Terminal-Bench-Science 0.1 ——一项让模型在终端里独立规划、执行并核验一套科学研究流程的评测。Fable 5.1 拿到 52.6%,上一代 Fable 5 只有 24.7%,翻了一倍还多。作为参照,OpenAI 的旗舰 GPT-5.6 Sol 在这一项上是 22.4%,Anthropic 自家的 Opus 5 是 29.0%。即便把 ± 3.5 到 4.5 分的标准误差算进去,这个翻倍也经得起推敲。AutomationBench 从 17.1% 涨到 31.4%,Terminal-Bench 4.0 从 42.0% 涨到 55.8%,Mythos 5.1 更是摸到 60.9%。

一个容易被忽略的细节是,Fable 5.1 的评测是在 " 生产级安全防护开启 " 的状态下完成的。 也就是说,这些分数是模型被安全网箍着跑出来的——在 OSWorld 和 AutomationBench 上,但凡防护机制出手拦截,直接记零分。这反而意味着真实的上限还要更高。

但能力的真正变化,藏在那批早期客户的只言片语里。

Jane Street 的量化研究主管 Craig Falls 说,Fable 5.1 比 Fable 5 和 Opus 5 解决了更多他们的编码难题,而且 " 以前的模型跑得越久越难读懂,Fable 5.1 在漫长的多步任务里始终可读 "。

Millennium 的一位高级基金经理讲了一个更具体的案例:一段大约百万分之一概率触发的罕见崩溃,团队里没人能在四五年里解释清楚,所有他们试过的模型包括 Fable 5 都错过了,Fable 5.1 是第一个找到的——它把外部供应商的库反汇编、和 core dump 对上了号,把崩溃追溯到了那个库的 bug。

Ramp 记录了一次 38 小时无人值守的机器学习任务,模型中途自行纠正了一个问题,连夜启动了六组实验,带着结果和下一步方案回来。MongoDB 的工程师描述了一个三天搭建复杂原型、夜里无人值守跑数小时的场景。

把这几件事连起来,结论已经非常清晰了:Fable 5.1 的 " 翻倍 " 不是靠把模型做得更大,而是靠把模型做得更 " 能撑 "。 它不再追求在单点上多答对几分,而是追求在长链条上少崩、少偏、少让人重来。这恰恰是 Agent 商业化的真正门槛——一个能在三小时内答对难题的模型,和一个能连续三天不跑偏的模型,卖的是两种完全不同的东西。

最强引擎配两副刹车:安全变成了一项可调参数

Fable 5.1 与 Mythos 5.1 的关系,是理解 Anthropic 战略意图的另一把钥匙。

官方表述极为克制:两者是同一模型,只是防护等级不同。Fable 5.1 全量开放,Mythos 5.1 只进 " 可信访问计划 ",护栏专门为网络安全和生命科学工作而调校。换句话说,Anthropic 把 " 能力 " 和 " 护栏 " 做了一次解耦。 过去安全策略倾向于给不同风险场景分配不同能力的模型,而这次的做法是,让同一个能力最强的模型,以不同的安全配置出现在不同的市场。

这背后的逻辑与缓存降价是相通的。当模型能力开始跨过 " 能连续工作数十小时 " 这条线,它对现实世界能做的事就不再是可控的玩具。同一个引擎,交给公众企业和交给网络安全、生物科学这类高风险领域,需要的约束完全不同。与其造两套能力不同的模型,不如造一套能力、两套护栏——既省了研发资源,也把安全治理的成本从 " 能力层 " 下移到了 " 准入层 "。

数据保留政策是同一思路的延伸。Anthropic 同时推出的 Enterprise Frontier Safeguards(EFS),让企业把监控数据存在自己控制的云基础设施里,达到 " 等同于零数据保留 " 的隐私水平,同时仍能保持顶级的对抗性滥用防护。这项功能从今年秋天起分阶段落地。在此之前,符合条件的企业可以先用零数据保留的方式跑 Fable 5.1。

安全误报也在被系统地压低:网络安全领域对良性内容的误拦减少了约 60%,基础生物学和医学问题的降级率降低了约 85%。

把这些拼在一起,Anthropic 实际在做的,是把 " 安全 " 从一个贴在模型外面的补丁,变成一个可以按客户分层配置的参数。对普通企业,少拦一点、跑得更顺;对高风险领域,多拦一点、准入更严。同一台引擎,不同的方向盘。

谁在为 " 记性好 " 买单?

把定价、能力和发布策略三条线合起来看,2026 年 AI 竞争的下半场轮廓就清晰了。

上半年,主战场是 " 单次智能的价格 "。OpenAI 用 GPT-5.6 的 Sol、Terra、Luna 三档把性价比算到极致,Luna 降到输入加输出合计每百万 token 1.4 美元,逼着整个行业往低价走。这是一场看得见的战争,比拼的是训练成本、推理效率和规模经济。

但 Anthropic 的这记缓存降价,把战争从 " 生成 " 转移到了 " 记忆 "。在它的叙事里,未来的 Agent 不是被调用一次就结束的 API,而是一个持续几小时、几天、甚至更久的工作主体。这样的主体,其成本结构里占比最大的不是 " 想出新话 ",而是 " 记住旧话、反复读旧话 "。谁能让 " 记忆 " 更便宜,谁就能让长时域 Agent 真正跑得动。

对真正在做长时域 Agent 的公司来说,Anthropic 这张牌的分量已经显现。Cognition 的联合创始人 Walden Yan 说得很直白:他们要在发布日当天把 Devin 里的 Opus 5 流量迁到 Fable 5.1,原因是 " 有了新的缓存读价,Fable 级模型终于对这类工作负载经济可用,从代码审查开始 "。这句话里藏着一个行业信号——此前,很多本可以上最强模型的重度工作,因为缓存成本不划算,被迫降级到次一档的模型。如今这个约束被拆掉了。

换句话说,Anthropic 降价降的不是模型,是 " 把最强模型当常驻 Agent 用 " 的门槛。 这比单纯便宜更有杀伤力,因为它直接改变了客户的选型逻辑,从 " 够用就好 " 变成 " 最强也养得起 "。

这场定价变局里,真正该紧张的未必是 OpenAI。OpenAI 的 Luna、Terra 降价瞄准的是长尾用户和大规模推理,它有自己的缓存折扣,也在 8 月给 Sol 临时降超两成。但它降价的主体仍是 " 输入输出 ",缓存仍按输入价的固定比例折扣。Anthropic 则把缓存读单独拉到地板价,相当于在 " 持续型 Agent" 这个细分场景里建立了一个价格锚点。短期内,两家在各自的主场都不会受致命伤。

更危险的是那些夹在中间的模型厂商——既没有 OpenAI 的规模去玩普惠降价,也没有 Anthropic 的纵深去重构成本结构。当头部玩家开始对 " 记忆成本 " 这个此前隐形的变量动刀时,跟随者会发现自己在两条战线上同时失血:单次智能比不过前者便宜,持续智能比不过后者便宜。

对用户和开发者,信号很明确:接下来评估一个模型,不能只看那张输入输出价签,还要把 " 你的工作负载里,有多少是反复读取的上下文 " 算进去。如果你的场景是一次性问答,Anthropic 的降价与你关系不大;如果你的场景是一个要跑几小时的 Agent,那这 75% 可能比任何 benchmark 分数都更值钱。

小结

曾几何时,我们评判 AI 只看 MMLU 分数,那是 " 脑容量 " 的时代;

半年前,我们比拼输入输出每百万 token 的价格,那是 " 脑转速 " 的时代;

而今天,Anthropic 用这 0.25 美元划出了一条新起跑线——" 记忆的租金 "

缓存读取价,这个长期待在价格表最不起眼角落的数字,正在成为 AI 竞争的新刻度尺。当模型足够聪明到能连续工作数十小时,决定它能不能规模化落地的,就不再是它想得有多快,而是它记得有多便宜。

当 AI 的记忆比人类的遗忘还便宜时,Agent 才真正从 " 玩具 " 变成了 " 工具 "。这场关于记忆成本的定价战,比任何一次参数升级都更接近 AI 商业的真相——因为它回答的不是 "AI 能做多难的事 ",而是 " 我们能放心让 AI 做多久的事 "。

Anthropic 用一刀 75% 把这个问题摆到了台面上,而台面下的答案,将决定未来一年 Agent 经济到底属于谁。(本文首发钛媒体 APP,作者 | 硅谷 Tech-news,编辑 | 赵虹宇)

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容