文|硅碳变量,作者|沈浪
9 月 17 日,在 2026 ITValue Summit 数字价值年会上,超聚变算力领域副总裁王梁栋指出,伴随大模型能力加速演进,AI 进入推理为主的 " 干活 " 时代,全球 Token 消耗将持续爆发,促使 AI 基础设施同步进化。
当下算力行业的竞争逻辑正在迭代,单纯依靠堆叠服务器和扩张硬件规模的粗放式发展路径,效用持续减弱。
随着 AI 重心从模型训练转向海量推理,算力基础设施正在经历底层变革,传统 " 堆硬件、扩规模 " 的建设思路,越来越难以匹配新阶段的产业需求。
Token 的真实账单
Token 不是噱头,是 AI 产业正在面对的真实账单。
当市场还在热议大模型参数、评测榜单这些显性指标时,一组持续攀升的 Token 调用数据正在揭示 AI 产业底层逻辑的转向:算力价值的重心正从一次性训练的峰值能力,向持续不断的推理开销迁移。
3 月 23 日召开的中国发展高层论坛 2026 年年会透露,今年 3 月,中国日均 Token 调用量突破 140 万亿,相比 2024 年初的 1000 亿,两年增长超千倍。同月,中国 AI 大模型周 Token 调用量连续三周超越美国,成为全球 AI 应用活跃度最高的国家之一。
来自全球最大 AI 模型 API 聚合平台 OpenRouter 的数据,进一步印证国内 AI 应用端的爆发。3 月 16 日至 22 日,全球 AI 大模型总 Token 调用量为 20.4 万亿,仅中国就达 7.359 万亿,占全球的 36%。
国内海量企业应用与智能体场景的规模化落地,正在推高 Token 消耗,让国内调用规模站上全球高位。
面向未来,多家机构给出了极具冲击力的预测数字。根据摩根大通的最新预测,中国 AI 推理 Token 消耗量将从 2025 年的约 10 千万亿增长至 2030 年的约 3900 千万亿,五年间增长约 370 倍。
IDC 的判断则更为大胆,全球年度 Token 消耗量将从 2025 年的 0.0005 Peta Token 增长至 2030 年的 15 万 Peta Token,年复合增长率高达 3418%;到 2031 年,全球活跃智能体数量将达到 3.5 亿个,而单智能体 Token 消耗量可达传统对话应用的百倍乃至千倍级。
和一次性问答对话不同,智能体需要自主规划任务、多轮调用模型以及反复试错迭代,每一次动作都会持续消耗 Token。一旦智能体场景规模化铺开,算力层面的成本账单或将持续走高。
当然,不同机构采用的统计口径和假设条件存在差异,数字本身不必纠结谁更精准,但背后的产业方向高度一致:AI 算力的重心,正从一次性训练,向持续性推理迁移。
AI 发展早期,行业叙事重心落在训练上。基座大模型训练属于一次性重投入,赛道比拼的是模型规模与参数上限。彼时客户挑选算力的思路相对简单,通常优先考量 GPU 显存和单卡峰值算力,市场竞争也围绕瞬时峰值性能展开。
当行业转向推理主导,算力的商业逻辑正在出现明显转变。推理不是一次性任务,而是 7 × 24 小时持续运转的流水作业。大模型嵌入各类业务系统,不间断承接用户请求和执行业务任务,算力集群必须长期在线。客户衡量算力方案的标尺,也随之调整。
客户不再只聚焦单卡峰值算力,转而更看重落地场景里的现实指标:集群单位时间能稳定输出多少 Token?单个 Token 的电力与硬件折旧成本,能否控制在业务可承受范围?大规模集群长期运行,能不能稳定跑满负载,减少宕机带来的业务中断和额外损失?
简单来说,训练比拼的是算力 " 爆发力 ",推理考验的是长期稳定输出的能力与单位 Token 成本。
训练是阶段性投入,基座训练任务收尾,大规模算力即可释放;推理需要长期在线承接请求,每新增一个 Token,都会产生一笔实打实的成本。
这正是 Token 数据值得重视的原因,它不只是发布会用来烘托热度的宣传素材,更是真实业务流量的写照,代表算力基础设施需要承接的业务压力,也是企业经营难以回避的成本账单。
这一变化,正在从需求端反向重塑 AI 算力产业链。
随着行业需求向高吞吐、低成本、高稳定性的推理集群倾斜,服务器架构、液冷方案、集群组网都迎来迭代压力。厂商竞争的评价维度,也从单卡硬件参数,向整套系统持续生产 Token 的效率延伸。
算力竞争的主战场,正在发生偏移:不再局限于实验室的训练任务,海量 Token 持续产出的真实业务场景,成为新的竞争阵地。
"8 卡服务器 " 这层窗户纸,快捅破了
过去几年,AI 数据中心的主流标准单元是 8 卡服务器:将 8 张 GPU 集成在单机箱内,接入网络,再批量部署数百上千台,配合配套设施,就能搭建行业所说的 " 万卡集群 "。
这套架构在模型参数维持在百亿、千亿级的阶段尚能胜任,但当模型走向万亿参数,百万路并发的推理请求持续涌入,原有架构的短板开始集中暴露:卡与卡之间、服务器与服务器之间的数据搬运,往往是制约性能的核心瓶颈之一。
即便芯片本身算力强劲,一旦数据无法及时送达,硬件算力便容易闲置,算力优势难以充分释放。
中国信通院在《AI 计算节点发展研究报告(2026 年)》里把这件事讲得很清楚:超节点的核心突破之一是通过在单节点或高密度机柜内大规模部署 NVLink 等卡间直连技术,将数十至上百张加速卡整合为一个内存统一寻址、算力无缝调用的 " 超级计算单元 "。卡间通信带宽显著提升,延迟明显降低,解决了张量并行等紧耦合任务中的通信瓶颈。
换个通俗的理解就是,与其采购 1000 台独立服务器,再依靠网线做跨机互联,不如将数百颗芯片以更高密度的互连方式,整合为一台逻辑层面的大机器。
钛媒体在《超节点如何成为 AI 算力的新答案?》一文中指出,超节点本质上就是把高带宽互连域从 8 卡扩展到 64 卡以上,让卡间通信变成接近内存访问的低延迟操作。
业内专家告诉钛媒体,大模型正在从能训练、能运行进入规模化生产阶段,问题不再是单卡峰值和卡数,而是系统能否稳定承载模型、持续产出有效 Token,同时控制时延与总成本。
这种架构迭代思路,并非单一厂商的独家创新。
比如,华为在全联接大会 2026 上发布的昇腾 960 超节点,单节点 4096 卡规模、提供 8E FP8 算力;联想在 WAIC 2026 展出了万全异构智算平台 V5.0 超节点方案;超聚变这类从服务器整机起家的厂商,则把 FusionPoD for AI 这样的整机柜方案推到台前。
赛道里的玩家各有侧重,但行业共识正在收敛:中大型 AI 数据中心的建设思路,选型重心正从零散采购独立服务器,向整机柜和系统级一体化方案倾斜。
很长一段时间里,8 卡服务器是 AI 算力基建的基础单元,也是行业沿用多年的主流范式。当产业重心以基座模型训练为主时,企业批量采购标准化 8 卡服务器并组建集群,可用于开展模型验证与早期训练工作。
这套模式标准化程度高且供应链成熟,支撑了前一轮大模型的快速落地。
不过当行业重心转向推理场景,海量 Token 持续消耗形成的业务压力,正在逐步显现这套架构的固有短板。跨服务器之间频繁的数据交互会带来持续的通信开销,容易拉高延迟,也推高电力与运维层面的综合成本。
随着业务对 Token 吞吐、集群稳定性、单位 Token 成本提出更高诉求,单纯堆叠 8 卡服务器的方案,边际效益或将逐步走低。超节点方案的兴起,可以看作行业试图突破 8 卡服务器架构局限的一次尝试。
当然,这并不意味着 8 卡服务器会快速退出市场。小规模研发测试、轻量化模型、边缘推理等场景下,8 卡单机仍保有灵活、成本可控的优势。
但面向承载大规模并发、海量 Token 消耗的中大型 AI 数据中心,依靠大量独立 8 卡服务器组网的传统范式,在适配业务需求上正面临越来越多挑战。
超节点不是算力终极答案
首先,超节点的价值有其清晰的场景边界,并不是可以覆盖所有业务的万能算力方案。
作为为大模型超高负载、高并发业务量身打磨的架构,超节点的性能与成本红利,更多体现在万亿参数模型训练、大规模推理集群这类高门槛大算力场景,也只有在这类场景下,它的价值才能充分释放。
在这类场景中,高密度互联、低延迟通信的架构优势可以显著改善传统 8 卡服务器集群面临的通信瓶颈,有效提升 Token 吞吐能力,压低整体算力成本。
但对多数中小规模业务来说,像轻量化模型迭代、小批量 API 服务、小规模研发测试、边缘推理这类场景,算力需求不大,业务架构也更为简单。这种场景下若强行部署超节点,很可能受架构冗余、系统复杂度上升、硬件深度绑定等因素影响,抬高部署与运维开支,让整体 TCO 显著上升。
其次,底层互联的技术路线还未走向收敛,方案选型仍有不少不确定性。
算力集群的通信能力,很大程度上决定超节点能达到的实际吞吐上限。目前行业正处于多条互联路线并行博弈的状态:NPO 近封装光学、CPO 共封装光学与传统光模块各有所长。厂商依托自家芯片与硬件架构选择不同方案,统一的行业标准还未落地。
昇腾 960 超节点将 4096 卡规模、FP8 8 EFLOPS 算力与 "5500 个 Hi-ONE 替代 4.8 万颗 800G 光模块 " 的革命性互联方案一并抛出,走出一条差异化的工程落地路径。而多条技术路线并行的格局,也意味着客户需要直面潜在选型风险。
倘若客户当下重金锁定某一类互联架构,一旦后续行业主流技术发生转向,硬件兼容改造、设备升级都会带来额外开支,前期投入的算力基建,可能遭遇技术迭代引发的资产折旧压力。
第三,还有一道所有算力基建项目都无法回避的现实拷问:硬件建成,集群能不能跑满?
算力项目是典型重资产投入,服务器、液冷与互联硬件前期一次性开支高昂,资产折旧周期漫长。即便超节点依靠架构优势提升了单卡利用效率,一旦缺少稳定持续的业务流量承接,再领先的硬件都可能闲置,居高不下的固定成本会持续侵蚀企业利润。
arXiv 上一篇研判 2026 — 2030 年 AI 基础设施的论文提到:通过 KV 压缩、稀疏性处理、量化以及路由到更小模型,每个 Token 传输的字节数每年以约 30% 的速度下降。Token 年增长率为 1.5 倍时,到 2029 年集群利用率将暴跌至约 45%,随后出现大规模产能减值 ; 增长率为 2.0 倍时,系统基本平衡 ; 增长率为 2.5 倍及以上时,整体产能将持续短缺,即便峰值周期的集群也能保持偿付能力。
换句话说,超节点解决的是如何更高效率产出 Token 的技术命题,却很难回应一个更底层的商业疑问:产出的这些 Token,能不能获得持续稳定的付费需求承接。
算力行业进入新阶段,竞争重心早已不是单纯堆叠更多芯片。真正的考验在于能否把每一张加速卡和每一度电,可持续地转化为市场愿意付费的 AI 服务。