文 | 影子备忘录
事情得从一封内部邮件说起。
2026 年 8 月初,微软执行副总裁 Jay Parikh 向全体员工发了一封内部信。信的大概内容是从 2026 年 7 月起,微软各业务部门都要有 "AI Token 预算目标 ",员工可以在内部仪表盘上实时查看自己的 AI 支出。内部默认模型也从原来的选项换成了 OpenAI GPT-5.6,原因只有一个:更便宜。
Parikh 在邮件里写了一句话,值得细品:"Tokenmaxxing 不是我们优化的目标。"
什么叫 Tokenmaxxing?这个词是 "token" 和 "maxxing"(刷到极致)的组合,跟 gymmaxxing(猛练健身)、looksmaxxing(极致改造外貌)是同一套互联网造词逻辑。
只不过它描述的是一种扭曲的激励机制,即把 AI 用量当成了企业内部的 KPI。
说白了,就是员工为了用 AI 而用 AI,疯狂刷 Token。
据微软内部数据显示,许多微软工程师每月的 Token 花费在几百到几千美元之间。
一个人一个月烧掉几千美元,这还只是成本端。放在整个公司层面,数字只会更吓人。
更有意思的是,微软 CEO 萨提亚 · 纳德拉自己今年 6 月就在一期播客上承认,他自己也是个 Tokenmaxxer,看着用量仪表盘上那些飙升的数字,确实很上瘾。
但 CEO 终究要算账,他又补了一句:生产率提升的边际收益,必须匹配 Token 的边际成本。不是每个问题都值得调用最强、最贵的前沿模型。
两个月后,CEO 的播客发言变成了公司的内部政策。
一家市值 3.5 万亿美元、刚刚在 OpenAI 身上砸了 130 亿美元的巨头,居然开始勒令自家员工省着点用 AI,这画面多少有点黑色幽默。
有微软员工直接在内部吐槽:一家在 AI 上重金投入、补贴了海量推理的公司,现在居然引导自家员工省钱?如果连托管 AI 基础设施的公司都需要担心自己能否负担内部 AI 产品,那购买这些服务的普通企业该怎么办?
这话问到了点子上。
四个月烧光全年预算,谁顶得住?
微软不是第一家踩刹车的,也不会是最后一家。
今年 4 月,Uber 首席技术官发了一份内部备忘录,公司在四个月内烧光了 2026 年全年的 AI 预算,罪魁祸首是 Claude Code 在 Uber 内部被大规模采用。
5000 名工程师中,月使用率在 84% 到 95% 之间,人均月度账单从 150 美元到 2000 美元不等。
这位 CTO 本人做一次两小时的内部演示,据说就消耗了价值 1200 美元的 Token。Uber 首席运营官 Andrew Macdonald 得知这个数字时 " 简直震惊得说不出话来 "。
值得注意的是,Uber 是一家市值超过 2000 亿美元的公司。连这种体量的企业都在四个月内把 AI 预算烧穿,你想想中小企业是什么处境?
Meta 那边也好不到哪去。据内部测算显示,如果维持当前员工调用 AI 的速度,2026 年仅内部 AI 使用一项支出就将达到数十亿美元。Meta 向约 6000 名核心员工发放了备忘录,明确了全员 Token 配额限制。
亚马逊高管也公开告诫员工 " 不要为了使用 AI 而使用 AI",考核指标从 Token 消耗量切换为标准化业务交付成果。
亚马逊还披露了一个更具体的案例:一套基于 Claude Sonnet 搭建的作者与商品页面匹配系统,最终耗资 180 万美元,项目成本远远超出原定预算,最后这套系统只被用来处理一些简单的琐事。
180 万美元处理琐事,这投入产出比,任何一个 CFO 看了都得心梗。
还有一家未具名的科技巨头,因为忘了给员工的 Claude 使用许可证设置上限,短短一个月内在 AI 上的支出高达 5 亿美元。社交媒体上的猜测几乎都指向了亚马逊。
从 Uber 到 Meta 到亚马逊再到微软,硅谷巨头们正在集体踩刹车。这已经不是一个两个公司的偶发问题,而是整个行业的结构性矛盾在集中爆发。
Token 为什么越用越贵?
这里有一个反直觉的现象:Token 单价在降,但企业的 AI 账单在涨。
2024 年,大模型厂商疯狂烧钱训练更大的模型,通过免费送 Token、低价倾销抢占市场。当时甚至有人说 " 卖 Token 不如卖矿泉水 ",每百万输入 Token 只要几毛钱,贵一点的模型不过一两美元。整个行业沉浸在 " 成本将持续下降 " 的叙事里。
事实也确实如此。主流大模型 Token 单价较 2023 年初降幅最高达 98%。
但问题出在用量上。
根据 OpenRouter 的统计,过去一年全球周度 Token 消耗量从 2.1T 激增至 24.5T,2026 年以来周度消耗同比增幅达 280%。
在国内,日均 Token 调用量从 2024 年初的 1000 亿飙升至 2026 年 3 月的 140 万亿,两年增长超 1000 倍。
单价跌了 98%,用量涨了 1000 倍。小学数学就能算出来,总支出只会涨,不会跌。哪怕微小的单位成本,乘以海量的使用规模后,最终总成本也是一个天文数字。
更致命的是,AI 智能体(Agent)类应用的爆发,让单次任务的 Token 消耗暴涨了数十倍。
以前你让 AI 写一段代码,消耗的 Token 是可控的;现在你让 AI Agent 自主执行一个任务,它可能要调用模型几十次、上百次,Token 消耗呈指数级增长。
供给端同样捉襟见肘。全球 Blackwell 芯片的算力增速是每年约 3.4 倍,而全球 Token 需求增速是每年约 10 倍。
3.4 对 10,差距在逐年撕裂。HBM 高带宽内存被三星、SK 海力士和美光三家垄断,扩产周期长达 24 到 36 个月。
算力租赁市场随之紧张,租用英伟达最先进的 B200 芯片的费用已翻了一番,接近每小时 6 美元。
所以你看,需求端在暴涨,供给端被卡脖子,Token 能不贵吗?
如果 Token 贵但产出高,那也认了。问题是,产出呢?
开发者生产力平台 Entelligence.AI 汇总了 2444 家企业的数据,得出了一组令人警醒的数字:每投入 1 美元的 AI Token 费用,仅有 18 美分产生了触达用户的实际价值。
44 美分用于修复 AI 自身引入的 Bug,27 美分流向返工,11 美分消耗于审查摩擦。
换句话说,一块钱扔进去,真正产生价值的不到两毛。剩下的八毛多,都在给 AI" 擦屁股 "。
Uber 首席运营官说得更直白:Token 消耗的增长与产品的实质改善之间," 这条线还不存在 "。
这才是问题的核心。
企业推动全员 AI 落地的初衷很清楚:用 AI 替代重复性人力工作、压缩人力开支、抢占 AI 转型先发红利。
但现实是,企业非但没有实现人力成本缩减,反而新增了一笔难以预估的巨额算力账单。大量 Token 投入能否转化为业务增量,仍然有待验证。
更尴尬的是,当前大模型仍无法深度适配细分业务场景,产出内容常常需要员工二次核对修正。员工只是从 " 生产者 " 变成了 " 审核者 ",企业并没有真正解放人力。
多数企业对 AI 的使用,也停留在浅层文案、代码辅助层面,没能搭建完整的 AI 业务闭环。
投了 130 亿美元的微软、市值超 2000 亿美元的 Uber、年资本开支约 2000 亿美元的亚马逊,这些巨头都在算不过来账的时候选择踩刹车。这不是技术问题,这是商业问题。
用户越多,亏得越多
说到微软,就绕不开 Copilot。
微软本来对 Copilot 用户收取固定费用,Pro 版本月费 10 美元,可用最顶尖模型的 Pro+ 收 39 美元。
但 AI Agent 出现后,数据吞吐量更大,推理成本越来越高,几十美元的月费根本承载不了。用户越多,微软亏得越多。
于是微软在 2026 年 6 月初改政策了,超出一定数量后按量收费。
结果全球开发者社群哀鸿遍野:许多重度依赖顶尖 AI 模型的工程师,不额外收费的基础额度几天就用完了,AI 使用费从 39 美元飙升至数百甚至数千美元。
GitHub Copilot 也全面转向了按用量计费。官方讨论帖收获了近 900 个反对票,有用户测算,一次智能体编程会话通常消耗 30 到 40 美元的 Token。这意味着一个月费 10 美元的套餐,单次使用就耗尽了。
微软自己都被自家员工的 Token 账单吓到了,不得不设限额。那些付费购买 Copilot 的企业客户呢?他们的账单只会更难看。
这形成了一个死循环:AI 公司不敢定高价,怕吓跑客户;但定低价又覆盖不了成本,用户越多亏得越多。
卖 Token 不等于稳赚不赔,当算力是固定成本而收入是变量时,每一笔订单其实都在赌客户会不会用满。
华尔街已经开始调转枪口了。Token 成本的飙升对计划在 2026 年底冲刺 IPO 的明星 AI 企业构成了最不愿见到的估值杀手。
公开市场投资者对毛利率和盈利路径的审视是极其严苛的。当核心输入成本以半年 40% 的速度递增时,谁能笑得出来?
你可能想,既然 Token 太贵,那就降价呗。
事实上,降价正在发生。2026 年 7 月 30 日,OpenAI 突然宣布 GPT-5.6 Luna 降价 80%,输出价格从每百万 Token 6 美元直接砍到 1.2 美元。
Terra 也下调了 20%。DeepSeek 更狠,V4 系列 Token 价格下调至原标价的四分之一。竞争加剧、成本下降,Token 迎来了一波降价潮。
但降价能解决问题吗?
短期看,降价确实能缓解企业客户的成本焦虑。但长期看,只要 Token 消耗量还在指数级增长,只要 AI Agent 还在让单次任务的 Token 消耗暴涨,降价带来的红利很快就会被用量吞噬。
更关键的是降价本身也在压缩 AI 厂商的利润空间。OpenAI 披露 2026 年算力支出将达 500 亿美元。谷歌、微软、亚马逊、Meta 四家科技巨头 2026 年在 AI 上的总投入预计达到 7250 亿美元,同比大增约 77%。
这边是巨额投入,那边是不断降价的收入端,利润空间被两头挤压。
目前唯一有望实现季度运营盈利的头部 AI 厂商是 Anthropic,其余厂商普遍处于亏损状态。
这就是 Token 生意的尴尬:卖得贵,客户用不起;卖得便宜,自己亏不起。
Token 正在沿着 IaaS 的老路滑向零毛利。通用推理 Token 加速商品化,利润越来越薄。
写在最后
2026 年 5 月,微软就已经取消了大部分员工的 Claude Code 内部许可。近 10 万名工程师被要求在 6 月 30 日前从 Claude Code 迁移到自家的 GitHub Copilot CLI。理由极其直白:账单太贵。
注意时间线:5 月取消 Claude Code,8 月出台 Token 预算目标。三个月内,微软在 AI 成本管控上连出两记重拳。这说明什么?说明问题不是突发的,而是积累到一定程度后的集中爆发。
更深一层看,微软取消 Claude Code 还有一个不能明说的原因:Claude Code 在微软内部太受欢迎了,风头盖过了微软自家的 GitHub Copilot CLI。
在开放 Claude Code 使用权限前,微软 91% 的工程团队都在用 GitHub Copilot。但在 Claude Code 开放后,这个使用率遭到 " 严重蚕食 "。
一边是自家产品被竞品碾压,一边是竞品按 Token 计费、每用一次都要给 Anthropic 付钱。
微软给 OpenAI 砸了 130 亿美元,还在 Azure 上为 Anthropic 搭建了大部分算力底座。结果自家工程师大规模调用 Claude Code 时,等于在给最直接的竞品输血。
看完账单后,这家市值 3.5 万亿美元的巨头决定不再当这个 " 冤大头 "。
这已经超越了成本问题,上升到了战略层面。
但即便是 " 内部核算成本 " 的 GitHub Copilot,边际成本再低,也架不住海量消耗。所以才有了 8 月份的 Token 预算目标。
这一切指向一个残酷的结论:Token 这门生意,巨头们自己都玩不转。
不是技术不行,不是产品不好,是经济账算不过来。每投入 1 美元只有 18 美分产生实际价值;用户越多亏得越多;单价降了 98% 但总账单翻了数倍。
这三个事实叠加在一起,构成了 Token 经济最尴尬的处境。
IDC 预测,2026 年中国 MaaS 市场的 Token 消耗量将达到 40000 万亿,较 2025 年增长约 20 倍。
用量还在涨,而且涨得飞快。但问题是,谁来买单?巨头们已经在踩刹车了,中小企业呢?个人开发者呢?
Token 作为 AI 时代的核心资源,相当于互联网时代的网络流量、工业时代的能源。
这些生产要素必须普惠低价,不能构成企业的主要运营成本。但现实是,Token 还没有便宜到那个程度。
也许再过几年,随着芯片产能释放、模型效率提升、基础设施完善,Token 真的会便宜到可以忽略不计。但至少现在,连卖 AI 的微软都扛不住了。
这不是 AI 的失败,这是商业规律在发挥作用。任何技术从实验室走向大规模商业化,都要经历成本与价值重新匹配的过程,AI 正在经历这个阵痛。
Token 被限额、AI 进度缓慢,不是 AI 不行,是经济规律在教所有人做人。