关于ZAKER Skills 合作
钛媒体 28分钟前

Gemini 3.8 Flash:谷歌把价格战打进了 token 消耗层

文 | AI 唱反调

大模型价格战,进入了暗战阶段。

9 月 2 日,谷歌发布 Gemini 3.8 Flash,单价一分没涨:输入每百万 token 0.75 美元,输出 3.75 美元。Artificial Analysis 当天的实测却发现,完成同一个任务的总成本涨了 40% ——模型每个任务多消耗了 30% 的输出 token。

价格表没动,账单动了。这个矛盾里,藏着下一代模型竞争的真正战场。

Gemini 3.8 Flash 在 DeepSWE 上追到离 Opus 5 只差 0.3 分,价格不到对方 1/6,代价是单任务 token 消耗上升 30%、明年初单价翻倍。Agentic 推理越多,账单越厚——成本竞争的口径正在从 " 每 token 价格 " 切换到 " 每任务成本 "。

一款什么样的模型

先把公开资料能确认的规格摆清楚。

Gemini 3.8 Flash 是谷歌 43 天里的第三款 Flash:3.6 在七月下旬,3.7 在八月十三日,3.8 在九月二日。皮查伊在财报电话会上说过,Flash 的目标是尽量接近月更节奏。

基准成绩集中在四类任务上:DeepSWE v1.1 长周期软件工程 73.7%,距离 Claude Opus 5 的 74.0% 只差 0.3 分;HLE-Verified 综合推理 54.9%,高于 Opus 5 的 54.4% 和 GPT-5.6 Sol 的 54.5%;Vals 金融智能体 61.4% 排第一;生成速度约 305 token/ 秒,是独立机构测过最快的商用模型。

定价上,当前优惠价输入 0.75 美元、输出 3.75 美元每百万 token,有效期到 12 月 31 日。作为参照,Opus 5 是 5 美元 /25 美元,GPT-5.6 Sol 是 4 美元 /20 美元。

模型现已进入 Gemini App、AI Studio 和 Antigravity 编程平台,Cursor、Vercel 等开发工具在发布当天完成接入。

技术机制:为什么会 " 多用 30% 的 token"

这次升级的核心设计,谷歌自己的表述是模型会 " 更努力地完成任务 "。

拆开讲就是 agentic 推理深度的提升。面对复杂任务,模型执行更多推理步骤、更频繁地迭代调用工具。数据流的变化大致是这样:

每一步都跑测试、查输出,最终答案的错误率被压下去了—— DeepSWE 能追平旗舰靠的就是这个。但每一轮 " 推理 - 工具 - 验证 " 循环都要消耗输出 token,步骤翻倍,token 消耗自然上去。高算力模式下,这个放大效应更明显。

Artificial Analysis 测出的数字链条是完整的:单任务输出 token 增加约 30%,折算成单任务总成本上升约 40%。即便涨完,单任务约 0.58 美元的成本,仍然落在 " 智能 - 成本 " 性价比前沿上——高推理档综合智能指数 59 分,比上代提高 3 分。

另一层价格变化在明年:优惠价到期后,单价将翻倍至输入 1.50 美元、输出 7.50 美元。用量涨一轮、单价再涨一轮,两波叠加才是完整的价格路径。谷歌同时保留 3.7 Flash 作为低成本选项,承诺继续支持。

为什么是现在

Flash 系列的升级节奏,指向的是开发者入口的争夺。

编程 Agent 和自动化工作流是当前 token 消耗增长最快的场景,也是各家 API 收入的主战场。这个场景的采购逻辑很现实:单位智能成本谁低用谁,迁移成本极低。DeepSWE 追到离 Opus 5 只差 0.3 分、价格不到六分之一,等于直接把 " 旗舰级编程能力 " 的商品价格打穿了一个量级。

同天发布的 Gemini 3.8 Flash Cyber 则补了另一条战线:CWE-Bench 漏洞修复 47.2%,与领跑的 Fable 5 基本持平;Chrome 安全团队实测其有效补丁产出是更大商业模型的 2.6 倍;Wiz 内部渗透测试召回率高出 7.5 到 9.7 个百分点,同等成绩花费仅为竞对的 1/2.3 到 1/5.2。这个版本不公开售卖,只通过 Fairwind 计划向约 650 家受信机构开放——与 Anthropic 把 Mythos 5.1 锁进可信访问计划的门控逻辑一致。前沿网安能力正在变成需要资质审核的战略资源。

合理推演是,谷歌的账算在规模上:Flash 承担开发者生态的走量任务,把使用习惯和工具链锁定在自家平台上,Pro 级别的利润款可以等能力差距真正拉开再发。这也解释了为什么六月预告的 Gemini 3.5 Pro 至今没有发布—— Flash 太强,Pro 的价格锚点立不住。

边界要摆上桌

基准口径的边界需要先讲清。

官方主打的四个基准全部领先,但第三方核对了完整榜单后,画面并不均匀。开放式 Agent 任务是明显短板:Terminal-Bench 4.0 上 Opus 5 拿到 51.8%,3.8 Flash 只有 19.1%;OSWorld 电脑操作 75.4% 对 59.0%。Harvey 法律基准上 10.0% 的 " 领先 ",实际是全榜模型集体不及格下的相对值。

规律大致是:边界清晰、终点明确的专业任务,它能贴着旗舰打;需要自主规划下一步的开放任务,差距会被拉开。沃顿教授 Ethan Mollick 的初步评价是 " 一个很好的 Flash 模型,但并不等于前沿模型 "。

另外,所有对比数据均为厂商自测口径,发布日基准与生产环境表现历来存在差距。成本侧的实际影响也取决于任务结构:短问答场景几乎不受 token 放大影响,长链路 Agent 任务才是成本上升的重灾区。社区传闻称部分团队已在评估回迁 3.7 Flash 控制预算,尚无官方数据印证。

写在最后

这次发布可以确认的产品事实是:Flash 系列的迭代周期压缩到三周级,能力触及旗舰边缘,网安版本进入资质门控。

更值得注意的是成本竞争口径的迁移。当各家每 token 单价逐渐咬平," 完成一个任务烧多少 token" 就成了新的定价杠杆——推理更深、步骤更多的模型天然更贵,即便价目表一动不动。Anthropic 两天前把缓存读取价砍了 75%,打的也是同一本账。

对开发者的实际建议只剩一条:选型时盯住单任务成本,而不是单价。价格战的第二阶段,比的是谁的账单更会 " 藏 "。

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容