文 | 字母 AI
Gemini 3.8 Flash,来得比想象中还快。

就在前一天,Anthropic 刚发布了 " 全球最先进的 "Fable 5.1 和 Mythos 5.1;OpenAI 也已经开始为下一代模型 Astra 预热,官方称其将 " 很快 " 上线。新一轮前沿模型大战正在开打,谷歌要是再不拿出点 " 大牌 ",留给 Gemini 3 的型号已经不多了。
只看 Benchmark,Gemini 3.8 Flash 在部分任务上已接近 Opus 5。
在长程软件工程测试 DeepSWE v1.1 中,Gemini 3.8 Flash 拿到 73.7%,距离 Opus 5 的 74.0% 只差 0.3 个百分点;Terminal-Bench 2.1 上,它甚至以 89.4% 超过了 Opus 5 的 89.1%。

但这一次,便宜并不像看上去那么简单。
谷歌自己也提醒,3.8 Flash 会比上一代 "work harder" ——它会进行更多推理、调用更多工具,也消耗更多 Token。Artificial Analysis 的首轮测试里,3.8 Flash 的单任务成本反而比 3.7 Flash 上涨了约 40%。
也就是说,虽然 Token 没涨价,但完成一件事变得更贵了。
谷歌啊,在性能上向顶级模型学习就够了,不要连这种事情也学 Anthropic 啊……
Flash 碰上了旗舰模型
从谷歌公布的 Benchmark 来看,Gemini 3.8 Flash 这次最明显的提升仍然集中在 Coding 和 Agent 能力。
和 3.7 Flash 相比,它在长程软件工程测试 DeepSWE v1.1 上的成绩从 65.3% 提高到 73.7%,一下涨了 8.4 个百分点,距离 Opus 5 的 74.0% 只差 0.3 个百分点。

另外,面向金融分析任务的 Vals Finance Agent v2 中,3.8 Flash 拿到 61.4%,高于 Opus 5 的 58.6%;Harvey 的法律 Agent 测试中,3.8 Flash 为 10.0%,Opus 5 为 6.7%;衡量多学科专家级推理能力的 HLE-Verified 上,两者则分别为 54.9% 和 54.4%。



至少在一部分 Coding 和 Agent 任务里,Gemini 3.8 Flash 已经跑到了 Opus 5 身边。
不过,暂时还没能实现完全赶超。
在更难、更强调通用 Agent 能力的 Terminal-Bench 4.0 上,3.8 Flash 只有 19.1%,而 Opus 5 达到了 51.8%;GDPVal-AA v2 知识工作测试中,3.8 Flash 为 1545 Elo,Opus 5 则达到 1824;测试电脑操作能力的 OSWorld 2.0 上,两者分别为 59.0% 和 75.4%。
独立评测给出的结果也更接近这种判断:Artificial Analysis 跑完了 Gemini 3.8 Flash 的 low、medium 和 high 三档推理强度,其中 high 档在 Artificial Analysis Intelligence Index 上拿到 59 分,而 Opus 5 max 目前是 63 分。
顺便一提,昨天刚发布的 Fable 5.1 max 已经达到了 66 分,当前榜单前七个席位都被 Anthropic 模型的不同推理档位占据。

速度上,它保持了 "Flash" 的优势。在 Artificial Analysis 通过 Google API 进行的测试中,3.8 Flash high 的输出速度达到 304.6 Token/ 秒,在其比较组 195 个模型中排名第一。

和 Gemini 3.8 Flash 一起升级的,还有 Gemini 3.8 Flash Cyber。
新的 3.8 Flash Cyber 在 CyberGym 漏洞发现测试中超过上一代 3.5 Flash Cyber;在谷歌覆盖 20 种编程语言的内部真实漏洞测试中,成功率超过 70%;在 CWE-Bench 自动漏洞修补测试中则达到了 47.2%,超过 GPT 5.6 Sol。



有意思的是,这种专项训练开始反过来影响主模型。
谷歌称,3.8 Flash 和 3.8 Flash Cyber 共享同一个基础智能核心,而这一代在 Coding 和 Reasoning 上的提升,部分就来自网络安全这一高难度领域的训练。
模型价格正在从 Token 价格转向任务成本
如果只看 API 价目表,Gemini 3.8 Flash 几乎是一次免费的性能升级。
它的输入价格依然是 0.75 美元 / 百万 Token,输出 3.75 美元 / 百万 Token,缓存读取 0.075 美元 / 百万 Token,和 3.7 Flash 完全一样。性能涨了,Token 单价一分钱没涨。
但真正跑起来,账单可不是这么算的。
Artificial Analysis 的测试中,Gemini 3.8 Flash high 完成一个 Intelligence Index 任务的平均成本达到 0.58 美元,而上一代 3.7 Flash 只有约 0.40 美元。

原因很简单:3.8 Flash 变得更能 " 想 " 了,也更能花 Token 了。
Artificial Analysis 发现,3.8 Flash high 每个任务平均生成约 4.8 万个输出 Token,比 3.7 Flash 增加了 30%;在 Agent 测试中,它还会进行更多次交互。最终,虽然 Token 没有变贵,但为了完成同一套测试,需要购买的 Token 更多了。
值得注意的是,这并不是谷歌一家碰到的问题,Anthropic 刚用 Fable 5.1 展示了一个更极端的案例。
Fable 5.1 这次没有调整普通输入和输出价格,依然是 10 美元和 50 美元 / 百万 Token,但 Anthropic 把缓存读取价格从 1 美元直接降到了 0.25 美元,降幅达到 75%。
对于 Agent 来说,这是一次相当实在的降价。因为 Agent 在长时间工作时需要不断读取此前已经进入上下文的代码、文档和历史对话,缓存读取往往会占据大量输入 Token。Anthropic 估算,仅这一项调整,就可以让典型工作负载成本降低约 25%,高度 Agent 化的任务最高降低约 45%。
结果 Artificial Analysis 一跑,事情又被翻了个面。
Fable 5.1 max 虽然以 66 分登顶了 Artificial Analysis 智能指数,但它完成一次 Intelligence Index 任务平均要花 3.76 美元,上一代 Fable 5 max 只有 3.14 美元。
缓存读取便宜了 75%,Fable 5.1 的单任务成本反而贵了 20%。
问题还是出在 Token 消耗,但 Fable 5.1 不是 " 太能想 ",是 " 特能唠 "。
Artificial Analysis 发现,Fable 5.1 max 生成的输出 Token 大约是 Fable 5 的 1.7 倍。缓存降价已经为每个任务省下约 1.40 美元,如果没有这次 75% 的缓存折扣,它的单任务成本甚至会达到约 5.16 美元。

现在的前沿模型正在越来越多地用计算量换成功率:更长的思考、更多的输出、更频繁的工具调用、更长的 Agent 执行链,都可以把 Benchmark 再往上推一点,但这些动作最后都会进入账单。
过去比较模型价格,一张 API 价格表基本就够了,0.75 美元还是 10 美元 / 百万 Token,是一个非常直观的数字。但到了 Agent 时代,这个指标正在变得不那么可靠。
毕竟,Token 只是模型公司的计价单位——任务才是用户真正付钱购买的东西。

但也并不是模型用了更多 Token 就一定不好,关键还是要看性价比,看多花掉的这些 Token,换来的任务成功率有多少。
Gemini 3.8 Flash 其实也说明了这种变化的另一面:虽然 high 档单任务成本涨到 0.58 美元,但它以 59 分的智能指数,仍然处在 Artificial Analysis 的 Intelligence vs. Cost per Task 帕累托前沿,被评为目前达到这一智能水平最便宜的模型。

谷歌更新 Flash 模型的速度,实在有些太快。
7 月 21 日,谷歌发布 Gemini 3.6 Flash;23 天后的 8 月 13 日,3.7 Flash 上线;又过了 20 天,3.8 Flash 已经接棒。
43 天,三个版本。
有网友调侃:AI Benchmark 现在的保质期,已经和超市里的三明治差不多了。

而谷歌之所以能更新得这么频繁,一个重要原因是,这几次并不是传统意义上的模型换代。
3.7 Flash 建立在 3.6 Flash 之上,主要是在原有基础上继续做算法和能力优化;到了 3.8,谷歌直接明牌,3.8 Flash 就是基于 3.7 Flash 继续迭代。这一次谷歌甚至连架构、训练数据、软硬件等信息都直接让开发者参考上一代模型卡。

以前,一个新的大模型版本往往意味着一次明显的代际跃迁:GPT-4 到 GPT-5,Gemini 2 到 Gemini 3。模型公司训练一个新的底座,再围绕它发布一整套产品。
但现在,大模型越来越像软件了。
模型上线之后,开发者开始使用,真实任务暴露问题;模型公司再根据反馈调整算法、后训练和推理策略,强化 Coding、Agent 或者某些专项能力,然后几周后直接推一个新版本。
前面提到的 Cyber,也是这种迭代方式的一部分。
最早的 3.5 Flash Cyber 先在网络安全这个高难度领域进行专项训练,强化漏洞发现、验证和修补;到了 3.8,一部分在 Cyber 训练中获得的 Coding 和 Reasoning 能力,又被带回通用 Flash 模型。
专项模型不再只是从通用模型上分出去的一条支线,也可以反过来成为下一版通用模型的训练场。
于是,大模型的版本迭代开始形成一种越来越接近软件开发的循环:
模型上线、真实使用、收集反馈、专项强化,然后发布下一版。
某种意义上,谷歌的模型发布正在从 " 换代 ",变成 " 更新 "。
对一家靠搜索、浏览器、云服务和广告系统长大的公司来说,谷歌最熟悉的就是让产品长期运行在真实用户面前,在真实流量里不断测试、更新和优化。
现在,谷歌正在尝试把这种工程方式搬到模型上。
甚至就连最近 Google DeepMind 的人事调整,也能和这条路线联系起来。8 月 5 日,Koray Kavukcuoglu 升任 Google DeepMind 高级副总裁。过去一年多,他实际上已经负责 Gemini 模型开发;这次调整则进一步把前沿 AI 研究、Gemini App 和开发者团队也纳入了他的职责范围。
模型、开发者反馈和产品,被放进了一条更短的组织链路里。
理想的情况下,模型不再需要等研究团队完成一次 " 大版本 ",再经过漫长的产品化过程才交到用户手里;研究、模型、开发者和产品之间的反馈,可以直接推动下一次迭代。
对 Gemini Flash 来说,3.6、3.7、3.8 或许已经不太能看作一次次独立的新品发布,更像同一个产品不断滚动的版本号。
由于更新得太过频繁(且一直拿不出 Pro 和 Gemini 4),甚至被网友评论:要不然直接把模型名也改成 Flash 吧。

网友的吐槽非常直接:所以你们偏偏选择在 Fable 5.1 和 Astra 之间发布?到底用了什么小丑逻辑做出这个决定?
