关于ZAKER Skills 合作
钛媒体 36分钟前

超节点绕行英伟达:国产算力换了一条赛道

文 | 互联网随笔

Kimi K3 发布技术报告的时候,在官方部署文档里写了一句让整个算力圈没法淡定的话:推荐在 64 卡及以上超节点配置中部署。

这是超节点第一次被写进大模型的 " 安装说明书 ",而且是作为硬性门槛出现的——不是 " 最好有 ",是 " 没有不行 "。Kimi K3 有 2.8 万亿参数、896 个专家,MoE 架构下的通信量大到惊人,跨节点通信一旦卡壳,推理效率直接崩盘。你不用超节点,最新模型连该有的性能都跑不出来。

没过多久,阿里云真武 M890 超节点实例上线,Kimi K3 和通义千问 3.8 Max 都开始在上面跑。供给端和需求端正在互相拉着往前走。

行业集体转向,很少是因为技术成熟了。大多数时候,是老路真走不下去了。

算力最值钱的东西不是芯片,是系统

SemiAnalysis 估算过,单颗国产 AI 芯片的性能大概只有英伟达 Blackwell 的三分之一。先进制程被卡着,这道坎短期内谁也迈不过去。更麻烦的是,大模型的参数奔着数万亿去了,MoE 架构下每蹦出一个词元,成千上万颗 GPU 就得来回同步参数、交换数据。

传统的 8 卡服务器,卡加得越多,通信等待时间越长,算力利用率反而往下掉。算力每两年翻三倍,内存带宽只涨 1.6 倍,互连带宽才涨 1.4 倍。芯片算得再快,数据供不上、传不动,全是白忙活。

超节点的做法很简单——用高速互联把成百上千颗芯片绑成一个逻辑统一的算力集群,让它们像住在一个屋里的邻居,数据不用再排着队过独木桥。华为内部算过,单颗昇腾确实不如英伟达,但昇腾 950 超节点的整体性能做到了 GB200 NVL72 的 1.7 倍。

翻译一下就是:你单卡强,我认。但我不跟你比单卡了,换个战场重新定规矩。

英伟达真正的护城河是 CUDA 生态——十几年积累,几百万开发者,你在单卡上跟它打,等于在人家的主场踢球。但超节点拼的是集群调度、互联效率、系统稳定性,是上万颗芯片连着跑十天半个月不出岔子的工程本事。这套系统工程能力,英伟达并没有几十年的先发优势,大家的起跑线没差那么远。超节点相当于绕开了英伟达守了几十年的正门,从侧面撕开了一个口子。

三条路线,谁能跑出来?

今年 WAIC,各家把超节点方案都摆到了展台最前面,路子却完全不同。

第一条路:往大了干,靠规模碾压。华为昇腾 950 超节点做了 1024 卡,满配能顶到 8192 卡,目前业内最大。中科曙光更狠,十万卡集群曙光 8000 直接落地郑州国家超算互联网核心节点,上线就满载。这个量级的集群考验的不是堆卡能力,是系统架构、网络互连、访存效率、能效控制——每一项都是在挑战工程极限。

曙光 8000 有个设计很有意思,叫 " 原生超智融合 " ——同一套系统从 FP64 科学计算精度到 INT8 推理精度全都能跑,一套底座既能训大模型,也能做气象预报、基因测序。

中科曙光高级副总裁李斌原话挺实在:从万卡到十万卡,乘以 10 这件事本身不难,难的是乘完 10 之后,性能还能不能跟着乘 10。规模大了之后最大的难点在于能否跑出应有的性能和效率,任何一个环节的短板都会导致性能折损。

第二条路:往底层钻,换传输介质。如果说华为和中科曙光是在 " 做大 ",壁仞是在 " 做透 " ——从传输介质这个根上重新写规则。

壁仞搞了个 NPO 光互连方案,用光信号代替铜线,单个超节点能扩展到 1024 卡。铜缆电信号超过 3 米就开始严重衰减,现有方案顶多支持 128 张 GPU,英伟达也在撞这堵墙—— 2026 年 GTC 上黄仁勋亲口说要用光互连把系统从 NVL72 拉到 NVL576。壁仞不光是换线,还把 GPU 节点和交换机节点物理分开,用光纤灵活互连,彻底甩掉了大铁盒子形态。

第三条路:往便宜了做,把门槛降下来。 中兴 OEX 走开放解耦,兼容好几家芯片,客户自己搭配。中科曙光在这个方向上也下了注—— scaleX40,全球首个无线缆箱式超节点,40 卡的标准 19 英寸箱式设计,部署从小时级压缩到分钟级,现有机房直接塞进去就能用。

不是谁都要十万卡的,40 卡才是大多数企业用得起的量—— 40 卡正好落在性能与成本的平衡点上。中科曙光两条腿走路:往上顶到十万卡的天花板,往下把门槛降到中小企业够得着。这种 " 两头押注 " 的打法,在这一轮超节点竞赛里并不多见。

英伟达先做芯片,国产先做超节点

回头看英伟达的走法:先迭代 GPU 架构,再升级 NVLink 互联,最后用 NVL72 的形态把芯片和互联打包成完整超节点。国产算力产业走了条完全相反的路——先把超节点这个系统级方案做出来,再去倒逼每颗芯片的设计。制程追不上就不追了,在系统层面重新定规矩。

一旦系统级效率成了新标准,单卡性能差距就没那么要命了。你不用在别人家门口踢一场必输的球——你自己画了块场地,按自己的规则踢。

这事最值得琢磨的地方在于:英伟达被挑战,从来不是因为有人在单卡上超过了它。AMD 没有,英特尔也没有。真正让英伟达紧张的,是有人在系统层面重新定义了算力供给的方式。

国产算力产业赌的就是这件事——不跟你打你擅长的仗,在你还没建立起绝对优势的领域抢先布子。

相关标签

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容