关于ZAKER Skills GEO服务 合作
财联社-深度 28分钟前

伯恩斯坦拆解 AI 基建成本:每 GW 投资最高 395 亿美元

财联社 10 月 10 日讯(编辑 夏军雄)伯恩斯坦 10 月 5 日发布的研报显示,采用不同 AI 加速器架构,建设 1GW 数据中心所需的资本开支约为 346 亿至 395 亿美元。其中,英伟达 Vera Rubin 架构的建设成本最高,OpenAI 自研 ASIC 架构 Jalapeno 则相对较低。

尽管不同 AI 芯片和服务器系统的价格差异显著,但换算至相同供电规模后,数据中心整体建设成本的差距明显缩小。

伯恩斯坦将英伟达 Rubin NVL72 单机柜成本预期从此前的 910 万美元大幅下调至 752 万美元,降幅约 17%,主要反映了对 HBM 价格和 NAND 存储容量预期的调整。

研报还指出,AI 数据中心的主要经济负担并非电费,而是巨额资本开支及其产生的折旧。随着英伟达 Rubin 和定制 ASIC 推动算力供应增长,AI 基础设施的成本结构及投资回报正成为行业关注的核心问题。

1GW 数据中心投资最高接近 400 亿美元

伯恩斯坦根据行业专家访谈、供应链调查、企业披露及第三方数据,对英伟达、AMD、谷歌和 OpenAI 的主要 AI 加速器架构进行了成本比较。

研究团队估计,英伟达 GB200 NVL72 单机柜成本约 413 万美元,新一代 Vera Rubin NVL72 则达到 752 万美元。AMD MI455X Helios 机柜成本约 733 万美元,与 Rubin 接近。

(不同 AI 芯片架构的系统成本构成)

相比之下,谷歌 TPU v7 Ironwood 单套系统成本约 269 万美元,而采用双机柜设计的 OpenAI Jalapeno 系统成本约 503 万美元。

不过,单套系统的价格并不能直接反映数据中心整体建设成本,因为不同架构的功耗和硬件配置存在显著差异。

按照伯恩斯坦的模型,建设 1GW 数据中心,采用英伟达 Rubin 架构需要约 395 亿美元,AMD Helios 约 357 亿美元,谷歌 TPU v7 约 390 亿美元,OpenAI Jalapeno 约 346 亿美元,英伟达 GB200 则约 365 亿美元。

一个值得关注的现象是,谷歌 TPU 单套系统成本不足 Rubin 的 40%,但两者每 GW 数据中心的总投资仅相差约 5 亿美元。原因在于不同系统的功率密度存在较大差异。

伯恩斯坦估计,Rubin NVL72 单机柜功耗约 220 千瓦,TPU v7 单套系统约 80 千瓦。计入配套基础设施的用电需求后,每 GW 数据中心需要约 3557 套 Rubin 系统,却需要约 9783 套 TPU 系统。

最终,两种架构每 GW 对应的计算系统硬件投资分别约为 268 亿美元和 263 亿美元,差距相当有限。

此外,数据中心还需要投入大量资金建设冷却、电力及其他基础设施。

伯恩斯坦估计,对于英伟达 Rubin、AMD、谷歌 TPU 和 OpenAI 架构,每 GW 数据中心的机柜外基础设施成本约 127 亿美元,其中土地及建筑约 45 亿美元,电力设施约 32 亿美元,冷却设施约 18 亿美元,其他机电设施约 32 亿美元。

这一估算假设,AI 计算机柜用电约占数据中心总负荷的 78%,对应 1.15 的电能使用效率(PUE)以及服务器机柜占全部 IT 设备功耗 90% 的假设。

上述结果意味着,虽然自研 ASIC 可能降低芯片和单套服务器的价格,但能否显著降低整个数据中心的建设成本,还取决于功率密度、网络架构和所需硬件数量。

需要说明的是,这些数据衡量的是相同供电规模下的资本开支,并不代表不同架构能够提供相同的 AI 计算性能。

Rubin 成本预期下调 17%

伯恩斯坦最新估算显示,Rubin NVL72 单机柜成本约 752 万美元,低于此前预测的 910 万美元,也与供应链流传的 700 万至 800 万美元价格区间基本一致。

调整主要来自五个方面:下调 NAND 存储容量假设、降低 HBM4 价格预期、修正网络设备成本、调整冷却和供电系统成本,以及更新 DRAM 和 NAND 价格。

其中,HBM 价格预期的变化尤其显著。伯恩斯坦将 HBM4 价格假设从此前的每 GB 48 美元下调至 30.6 美元,降幅约 36%。

分析师认为,供应链反馈弱于此前预期,同时对 HBM 利润率最终与传统 DRAM 趋同的判断信心有所下降。

不过,伯恩斯坦仍预计英伟达能够向终端客户转嫁部分内存成本,并对 HBM 加收约 10% 的溢价。

按照每机柜 20.7TB HBM4 容量计算,Rubin 的 HBM 成本约 69.7 万美元。

GPU 本身仍是最大的成本来源。伯恩斯坦估计,Rubin GPU 单价约 5.5 万美元,72 颗 GPU 合计 396 万美元,占整套机柜成本的约 53%。

此外,伯恩斯坦大幅降低了对 Rubin 内部 NAND 存储容量的估算。

此前模型假设,机柜内部 NAND 容量可能达到约 2.2PB,并计入约 1.2PB 外部 ICMS 存储。最新模型则将内部 NAND 容量下调至 576TB,同时将外部 ICMS 以及未来的 CMX 存储排除在机柜物料成本之外。

这一变化表明,Rubin 成本预测下降不仅反映硬件价格变化,也与存储配置及成本统计范围调整有关。

值得注意的是,传统内存价格反而有所上涨。伯恩斯坦将 DRAM 价格假设从每 GB 14.85 美元上调至 16.45 美元,TLC NAND 价格从 0.37 美元上调至 0.38 美元。

由此估算,Rubin 每机柜 CPU 侧 DRAM 成本约 88.8 万美元,直接连接 NAND 存储约 22.2 万美元。

伯恩斯坦提醒,当前内存价格波动较大,相关成本模型可能很快需要重新调整。

除计算和存储外,Rubin 网络设备成本约 117 万美元,其中 Scale-up 网络约 59 万美元,Scale-out 网络约 50 万美元,前端网络约 8 万美元。

随着系统功率密度提高,冷却系统成本也明显增加。伯恩斯坦估计,Rubin 单机柜冷却成本约 10.2 万美元,较 GB200 的 5.1 万美元翻倍。

AMD GPU 价格更低,但机柜总成本与 Rubin 接近

相比之下,AMD Helios 虽然单机柜成本与 Rubin 接近,但内部结构存在明显不同。

伯恩斯坦估计,AMD MI455X GPU 不含 HBM 的单价约 3.5 万美元,低于 Rubin 的 5.5 万美元。72 颗 GPU 合计约 252 万美元,比 Rubin 低 144 万美元。

分析师认为,部分差异可能来自 AMD 较低的 GPU 利润率。

但 AMD 在其他硬件上的投入更高。

Helios 每机柜配置约 31.1TB HBM,高于 Rubin 的 20.7TB,对应 HBM 成本约 95 万美元。

其 CPU 侧 DRAM 容量估计达到 74TB,成本约 121 万美元,也明显高于 Rubin。

网络部分差异同样突出。AMD Helios 每机柜网络设备成本约 147 万美元,高于 Rubin 的 117 万美元。

伯恩斯坦指出,AMD 采用基于以太网的 UALink 互联方案,部分 Scale-up 交换设备由 Celestica 提供,相关交换机成本可能低于英伟达的专有方案。

但 AMD 每颗 GPU 最多配置三个网络接口控制器,增加了 Scale-out 交换机、网络接口及光收发器需求,抵消了部分成本优势。

尽管 AMD 的 GPU 成本比 Rubin 低约 144 万美元,但其 CPU、DRAM、HBM、网络设备及 NAND 存储成本更高,抵消了大部分价格优势。最终,AMD Helios 单机柜总成本约 733 万美元,仅比 Rubin 低约 19 万美元。

需要注意的是,伯恩斯坦对 AMD 的 NAND 容量采用了较为激进的最大配置假设,实际存储需求可能低于估算。

OpenAI 与谷歌尝试重构 AI 计算架构

报告还重点分析了 OpenAI 和谷歌的自研 AI 芯片架构。

伯恩斯坦认为,OpenAI 的 Jalapeno 并非简单地将英伟达 GPU 替换为价格更低的 ASIC,而是在网络和内存配置上采取了不同的设计思路。

Jalapeno 是一套针对 AI 推理优化的双机柜系统。

其中,主机机柜包含 16 个 Katsu 托盘,共 32 颗 Turin 级别 CPU;另一个机柜包含 16 个 Vindaloo ASIC 托盘,合计 128 颗 ASIC,并配置 Chana 交换机托盘。

伯恩斯坦估计,每颗 ASIC 连同 HBM 的价格约 2.25 万美元,128 颗合计 288 万美元。

其中,HBM 容量约 27.6TB,对应成本约 84.6 万美元,剔除 HBM 后的 ASIC 平均价值约 1.6 万美元。

整套 Jalapeno 系统成本约 503 万美元。

更重要的区别在于网络设计。

伯恩斯坦指出,OpenAI 试图扩大 Scale-up 互联范围,将更多数据保存在本地 HBM 和 DRAM 中,从而减少对传统 Scale-out 网络及 NAND 存储的依赖。

Jalapeno 的 Scale-up 网络采用博通 Tomahawk 6 交换芯片,并引入光电路交换(OCS)技术。

按照伯恩斯坦估算,该系统采用约 10 颗交换 ASIC,相关交换设备成本约 30 万美元。

此外,OCS 设备约 7.7 万美元,铜缆约 19.4 万美元,光收发器约 10.9 万美元,网络设备整体成本约 81 万美元。

分析师认为,虽然 Jalapeno 并未完全取消跨系统网络连接,但通过改变互联方式,可以减少对传统 Scale-out 交换设备的需求。

这种设计可能改变 AI 基础设施中不同网络设备的需求结构。

谷歌 TPU v7 Ironwood 则采取另一条技术路线。

伯恩斯坦估计,其单套系统成本约 269 万美元,包括 64 颗 ASIC、16 颗 Axion CPU 以及配套存储和网络设备。

按照模型,TPU ASIC 不含 HBM 价格约 2.2 万美元,低于英伟达 GB200 GPU 接近 3 万美元的估算价格。

研究团队认为,这与博通和英伟达的利润率差异有关,其模型分别采用约 55% 和 70% 的利润率假设。

谷歌 TPU 采用 HBM3E,每颗 ASIC 配置 192GB,总容量约 12.3TB,成本约 27.5 万美元。

相比 Rubin 采用的 HBM4,较低的内存价格也有助于控制整体硬件成本。

网络方面,谷歌同样使用 OCS,但与 OpenAI 主要尝试减少传统 Scale-out 依赖不同,谷歌更多将其用于 Scale-up 互联。

伯恩斯坦估计,TPU v7 每套系统的 OCS 成本约 15.4 万美元,网络设备总成本约 54 万美元。

不过,分析师强调,谷歌和 OpenAI 的公开技术披露均不如英伟达完整,尤其是 NAND 配置及部分网络组件价格,仍主要依靠行业消息和模型推算。

因此,当前 ASIC 成本估算存在较大不确定性,随着更多技术信息披露,相关预测可能需要明显调整。

AI 数据中心最沉重的负担是折旧

在比较硬件投资之后,伯恩斯坦进一步测算了 AI 数据中心的运营经济性。

报告指出,即使采用相对较高的每千瓦时 0.15 美元电价,1GW 数据中心每年电力支出约为 13 亿美元。

相比之下,一座采用 Rubin 架构、总投资约 395 亿美元的数据中心,若将全部资本开支简单按照六年平均折旧,每年对应的折旧费用将达到约 66 亿美元。

这意味着,资本开支形成的折旧负担远高于电力成本。

伯恩斯坦认为,由于服务器、存储及网络硬件的使用寿命通常短于土地、建筑等基础设施,在分析 AI 算力的长期经济性时,IT 硬件的重要性甚至高于其在初始投资中的占比。

不同企业的折旧政策也存在差异。

据报告整理的数据,谷歌服务器和网络设备的折旧年限为六年,亚马逊为五年,Meta 为四至五年,微软相关计算设备为两至六年,CoreWeave 技术设备为六年。

伯恩斯坦进一步假设加速器使用寿命为五年、电价为每千瓦时 0.15 美元,并采用 40% 的利用率进行调整。

在该模型口径下,Rubin 每颗加速器的小时成本约 3.18 美元,AMD Helios 约 3.23 美元,谷歌 TPU v7 约 1.29 美元,OpenAI Jalapeno 约 1.27 美元,英伟达 GB200 约 1.77 美元。

不过,这些数字并非云服务商对外收取的 GPU 租赁价格,也不能直接等同于完成相同 AI 任务的成本。

由于不同架构的性能、实际利用率和适用工作负载存在差异,单纯比较每颗加速器的小时成本,并不足以判断其最终推理或训练经济性。

全球 AI 算力供给继续扩张

尽管建设成本高昂,伯恩斯坦仍预计全球 AI 算力设备出货规模将继续增长。

根据各类加速器出货量及其功率消耗估算,全球 AI 设备出货对应的数据中心功率规模预计从 2025 年的 27GW 增加至 2026 年的 35.5GW,并于 2027 年进一步升至 43.3GW。

其中,英伟达 Rubin 将逐步成为重要增长来源。

伯恩斯坦预计,Rubin 相关设备 2026 年出货对应功率约 8.3GW,2027 年进一步增加至 12.1GW。

与此同时,英伟达 B200 的对应出货规模预计从 2025 年的 9.9GW 下降至 2026 年的 5.4GW,2027 年进一步降至 0.2GW。

其他 GPU 和 ASIC 架构的合计出货规模则有望继续扩大。

不过,全球 AI 设备出货对应的功率规模,明显高于伯恩斯坦对美国本土数据中心新增容量的预测。

该机构预计,美国 2026 年新增数据中心容量约 18GW,2027 年约 26GW。

研究团队认为,这种差异一方面来自设备出货和实际部署之间的时间差,另一方面也可能反映 AI 基础设施建设正在更多转向海外。

美国数据中心项目面临电力供应、运营条件及政策限制等挑战,可能推迟部分新增容量投入使用。

伯恩斯坦提到,OpenAI 与 Firmus 围绕澳大利亚、新加坡、印度尼西亚和马来西亚 AI 数据中心容量展开的合作,体现了海外基础设施建设的重要性。

分析师预计,未来全球数据中心容量中,美国所占比例可能低于历史水平。

与此同时,基础设施投资增加也将影响硬件产业链内部的增长格局。

伯恩斯坦预计,2025 年至 2027 年,中际旭创和新易盛的营收复合年增长率分别可能达到 92% 和 78%;台达电子及 Vertiv 同期预计分别增长 38% 和 32%。

但并非所有硬件供应商都能同步改善盈利能力。报告预计,部分服务器制造商虽然收入增长较快,毛利率却可能承压。

总体而言,伯恩斯坦认为,2026 年 AI 终端应用采用速度已有加快迹象,推动 AI 实验室快速增长。

随着英伟达 Rubin 进入新的产品周期,以及定制 ASIC 得到更广泛应用,伯恩斯坦预计,可用算力将进一步增加,为 AI 应用普及创造更多条件。

不过,报告同时表明,AI 基础设施的经济性不仅取决于芯片价格,还受到内存、网络、供电及折旧成本等多重因素影响。对于持续投入巨额资本开支的科技企业而言,如何提高硬件利用效率、控制整体建设成本,将成为影响长期投资回报的重要因素。

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容