
▍平头哥 AI 芯片产能逐步提升
阿里云灵骏真武 M890 超节点是国内首个成功运行超 2 万亿参数大模型的超节点形态算力,Kimi K3 和 Qwen3.8 Max 均已通过该实例对外提供服务。
据悉,灵骏真武 M890 超节点实例支持 FP8/FP4 低精度计算,通过 ICN Switch 1.0 芯片 Scale-up 互联规模由 16 卡拉升至 64 卡,卡间互联提升至 800GB/s。在智能驾驶、具身智能等训练场景中,相比上一代真武 810E,训练性能提升三倍。
支撑超节点集群的,是阿里云灵骏智算平台。依托 HPN 8.0 训推一体网络,单集群最高支持 13 万卡异构算力混布,并可扩展至百万卡级。
截至今年 4 月,平头哥真武 AI 芯片累计出货 56 万片,阿里云全球数据中心总经理王朝阳介绍,平头哥的产能在逐渐提升。"未来非常确定性的是,国产自有芯片的产能会持续提升,占比越来越高。而产能提升时间大概不需要三年。"
AI 时代来临,数据中心进入第四代——智算中心(AIDC)。数据中心的规模是过去的十倍,密度是十倍甚至几十倍,芯片也更加多样,需要兼容多种架构。阿里云也推进 " 一云多芯 " 战略,对多种芯片异构兼容。" 其他的一些芯片我们也愿意去适配模型、适配应用。" 王朝阳称。
据了解,基于全模块化设计架构 CUBE 5.0,阿里云已将大型 AIDC 数据中心的交付工期缩短至 100 天。同样的工期,国内传统交付周期为 6 至 12 个月,美国为 12 至 18 个月。在大幅缩短工期的同时,阿里云数据中心整体建设成本反而降低 10% 以上。
目前,CUBE 5.0 架构已在阿里云乌兰察布、中卫等数据中心试点跑通,并获得基于 EN 标准的欧洲 CE 认证和基于 IEC 标准的东南亚产品准入。今年,阿里云正计划将模块化数据中心的全球产能提升两倍以上。
王朝阳介绍,AI 算力需求爆发,数据中心交付的速度要求变高。传统的工期为串行施工,每一步都依赖上一步的完工,比如先安装供配电,再接空调。阿里云通过全模块化的设计理念,各个环节并行生产,工厂制造后,预调至集装箱,再运抵数据中心,现场像搭积木一样吊装。
▍ AI 推理算力呈现从西往东下沉的趋势
本次超节点实例首发地域乌兰察布是阿里云五大超级数据中心之一,该数据中心的绿电占比约 45%。
王朝阳表示,选择乌兰察布的核心因素就是电价。" 这个地方的电价大概是在 3 毛 2 到 3 毛 5 之间。而华东、华南普遍六毛到九毛。一个吉瓦级的数据中心,放在乌兰察布和放在东部,每年电费相差 50 亿元。

而以推理为中心的算力则正好相反,呈现从西往东下沉的趋势。这是由于东部地区是 AI 推理需求的主力爆发点,用户在这里,数据和业务在这里,AI 推理必须靠近用户。
王朝阳说预计,未来长三角、大湾区、京津冀三大经济圈,将来会出现大量的推理型算力集群,并逐步形成产业群的覆盖。" 举个例子,新兴的产业,数字化基础非常好的产业一定会成为 Token 使用聚集区域。"
▍未来单机柜平均功率或将突破 1000 千瓦
随着数据中心进入智算中心(AIDC)时代。数据中心的规模是过去的十倍,密度是十倍甚至几十倍,芯片也更加多样,需要兼容多种架构。这都必须要有大量的电力供应。
王朝阳表示,这使得数据中心选址需要选择能源富集的地方,才能发展大规模的算力。其次,功率密度越来越大,特别是 AIDC 时代单机柜功率密度已经达到了 100 千瓦,未来两年之内还会出现 1000 千瓦的机柜。
与此同时,供给端的瓶颈正在从芯片向更上游蔓延。王朝阳举例:" 最早是 GPU 产能不足,存储是一个瓶颈,后来电力供给又成为瓶颈,再后来光纤也出现瓶颈。中国一年生产 6 亿公里光纤,但仍然会出现瓶颈——因为一个十万卡集群就需要几十万公里光纤。而各个光模块也会出现瓶颈。"
谈及产能瓶颈,王朝阳表示,此前做过评估,在目前全中国产能约 8 吉瓦的情况下,可以比较好地覆盖当下芯片的产能需求。" 可能会出现局部的问题、短期的问题,但整体上没有大问题。"
王朝阳还提到高压直流技术的重要性。" 下一代数据中心如果采用 240 伏交流电,已无法承载当前密度,电缆在物理空间上超出物理极限。所以必须把电压升至 400 伏,甚至 800 伏、1500 伏。随着密度继续升高,电压还在往上走。"
此外,风冷和液冷兼容几乎是 AIDC 的标配,如何实现更高配比、更好效果是持续优化的方向。
在算电协同方面,王朝阳认为,GPU 时代功耗呈现垂直增长,这意味着需要用全新的技术来解决,目前中美在算电协同方面都进行了大量的尝试,但是仍然处在非常初级的阶段。相信随着算力中心的发展,会对当前的框架,包括电网的稳定性,包括发电企业等造成冲击,从而产生新的业态。