关于ZAKER Skills GEO服务 合作
钛媒体 1小时前

AI 智能体,正在让 CPU 身价暴涨

文 | 影子备忘录

从大模型训练到推理部署,产业的关注点几乎都绕着 GPU 打转。

显存够不够大、带宽够不够高、Token 吞吐量能达到多少,成为衡量 AI 基础设施能力的核心指标。英伟达的股价曲线,就是这场算力狂欢最直观的注脚。

但最近,一款应用让这个共识开始松动了。

9 月 8 日,Meta 正式发布个人 AI 智能体 Muse。上线约 10 天,它登顶美国 App Store 免费应用榜,超过 ChatGPT。

日活数据显示,Muse 美国移动端日活用户达到 64.2 万,而 ChatGPT 同期仅为 23.1 万,前者是后者的近三倍。

更值得关注的是它在资本市场的连锁反应:Arm 涨 17%、英特尔涨 12%、AMD 涨 10%,AMD 市值首次突破 1 万亿美元。

一款应用,凭什么搅动整个芯片板块?

一个应用,为什么把 CPU 推到了聚光灯下

先说说 Muse 到底和之前的 AI 有什么不同。

过去我们用 ChatGPT,模式是 " 你问它答 "。你输入一个问题,模型生成一段回答,任务结束。本质上,这是一次性的信息生成。

Muse 的逻辑完全不一样。它是 " 你交代它干 "。你可以让它连接 Gmail、Google 日历、OpenTable,甚至直接通过浏览器上网,替你发邮件、订餐厅、安排行程、网购下单。

你关掉 App 它还在后台继续跑,实现了 7 × 24 小时全天候工作。

Meta 的架构设计更值得细看。Muse 采用的是多代理设计:多个 " 工作代理人 " 平行运作,还有一个独立的 " 审查代理人 " 在后台检视。

每个子代理人都各自调用工具,每项任务会同时发出多次 CPU 运算请求;每个子代理人还保有自己的工作记忆,在运行期间持续保存,才能跨时段执行连续任务。

这意味着任务越复杂,CPU 请求与内存占用都是成倍放大。

更关键的是基础设施层面的设计:Meta 在云端给每个用户配了一台独立的 Linux 虚拟机(VM)。

这台虚拟机有自己的浏览器、文件系统、后台任务,配了 2 个 vCPU、8GB 内存和 100GB SSD。每个 Muse 用户背后,都对应着一套真实的 CPU 算力消耗。

有分析做了这样一个测算:如果 Muse 的用户规模扩展到 1 亿,光 CPU 就需要约 158 万颗。

这还只是一款应用。当 Agent 成为 AI 的主流形态,算力结构的变化将是系统性的。

Agent 改写了算力配方

要理解 CPU 为什么突然变得抢手,得先看清 Agent 到底在干什么。

传统的大模型推理是 " 一问一答 "。GPU 负责繁重的矩阵运算,CPU 只做简单的数据搬运和调度。

在这个模式下,一台 AI 服务器配 4 到 8 颗 GPU、1 颗 CPU 就够了,CPU 就是个 " 后勤人员 "。

但 Agent 的运转逻辑完全不同。

一个 Agent 接到任务之后,需要经历一连串步骤:理解意图、分解任务、选择工具、执行代码、访问数据库、调用 API、评估结果、调整策略。

这个链条上的绝大多数环节,包括逻辑判断、流程控制、数据调度等都是 CPU 擅长的领域。

行业研究机构 SemiAnalysis 的测算显示,在现代智能体代码工作负载中,约 42% 的执行时间被 CPU 驱动的工具调用所占用。

AMD 在 2026 年第一季度财报电话会上也明确表示,仅编排环节的耗时,就可以占总延迟的 50% 到 90%。

打个比方,以前的大模型推理像是一条流水线,GPU 是流水线上的主力工人,CPU 是给工人递零件的。

现在 Agent 来了,它更像一个项目经理,需要不停地拆解任务、分配资源、协调工具、检查进度。GPU 还是干重活的工人,但项目经理的工作量,也就是 CPU 的工作量暴增了。

英伟达 CEO 黄仁勋在发布 Vera CPU 时说了一句很直白的话:"Agent 没有耐心,它们生活在纳秒级的世界里。当它使用工具时,它希望响应时间尽可能快。在这条路径上,CPU 如果效率不够高,将阻止 Agent 执行下一步。"

这句话反过来读也成立:CPU 不够强,GPU 就得闲着。这就是 CPU 在 Agent 时代的真正价值,它不是取代 GPU,而是决定 GPU 能不能被充分利用。

算力配比的范式转移

这种变化,最直观地反映在 CPU 与 GPU 的配比上。

在模型训练时代,AI 数据中心 CPU 与 GPU 的配比大致是 1:4 到 1:8。GPU 是绝对主角,CPU 只是配套。

但进入 Agent 推理时代,这个比例正在快速收敛。AMD CEO 苏姿丰在财报会上明确表示,比例正从 1:4 至 1:8 逐步收敛至 1:1,甚至在智能体密集部署场景下,CPU 配置数量可能反超 GPU。

ARM 的测算更激进:传统 AI 数据中心每吉瓦功率需要约 3000 万个 CPU 核心,而在 Agent 时代,这个数字将飙升至 1.2 亿个,直接翻四倍。

从 1:8 到 1:1,这不是微调,是范式转移。

伯恩斯坦的研报给出了一个更具体的判断:在智能体工作负载中,CPU 的计算占比将从传统 LLM 的 14% 跃升至 50%,与 GPU 平分秋色。

报告将 2030 年全球服务器 CPU 市场规模预期从此前的 1370 亿美元上调至 2230 亿美元,年复合增速达 43%。

摩根士丹利的测算同样乐观:到 2030 年,Agentic AI 可能带来 325 亿美元至 600 亿美元的 CPU 增量市场,整体服务器 CPU 市场规模有望超过 1000 亿美元。

这些数字背后,是整个产业对算力结构的一次系统性重估。

当需求端发生结构性变化,供给端不可能无动于衷。

事实上,CPU 市场已经开始经历一轮罕见的涨价潮。传统 CPU 市场长期遵循 " 价格只降不升 " 的运行逻辑,但 AI 带来的算力需求正在改写这一规律。

英特尔今年以来消费级 CPU 经历三轮调价,Plus 系列累计涨价幅度接近 30%;高端 Xeon 服务器产品整体涨幅达 7% 至 12%。AMD 下半年针对中高端服务器 CPU 价格预计还将上调 4% 到 7%。

更值得关注的是供应链信号。KeyBanc 数据显示,由于超大规模云服务商 " 扫货 ",英特尔与 AMD 在 2026 全年的服务器 CPU 产能已基本售罄,两家公司均计划将服务器 CPU 价格上调 10% 到 15%。

部分服务器 CPU 型号自年初以来价格涨幅已超过 40%,客户真正担心的已经不是价格高低,而是未来还能不能拿到货。

缺货态势已从高端服务器 CPU 蔓延至全品类。此前 CPU 常规交期仅 1 到 2 周,当前已拉长到 8 到 12 周,服务器级 CPU 产品交期更长。渠道市场甚至出现了 " 空仓、断供、二手溢价 " 的现象。

这种供需失衡的根本原因在于:过去几年,全球半导体产业的先进产能大量倾斜给了 GPU 和 AI 加速器,CPU 的产能扩张相对保守。

当 Agent 时代突然拉高 CPU 需求时,供给侧没有足够的弹性来快速响应。

芯片巨头们已经用行动投票

如果说市场数据反映的是 " 预期 ",那芯片巨头们的产品布局反映的就是 " 行动 "。

在 2026 年台北国际电脑展上,四大芯片巨头不约而同地把 CPU 推到了舞台中央。

英伟达发布了 Vera CPU,它是首款专为智能体打造的 CPU,搭载 88 个 Olympus 核心,任务完成速度比传统 x86 CPU 快 1.8 倍。

黄仁勋明确表示:"AI 智能体将成为计算资源的最大用户,而 Vera 正是专为在超大规模基础设施中运行智能体 AI 而生。"

要知道,英伟达是 GPU 的代名词。当这家全球最成功的加速器公司开始专门为 AI 打造 CPU,并在产品命名上直接叫 "the CPU for agents",这本身就是一个强烈的信号。

高通 CEO 将 2026 年定义为 " 智能体之年 ",指出 " 你需要一个非常强大且高能效的 CPU 来负责任务的编排规划 "。

英特尔推出基于 18A 工艺的至强 6+ 处理器,配备 288 颗能效核,单机架最多可支持 15 万个 AI Agent 运行。Arm 则发布了 AGI CPU,强调能效比,单机架级性能可达传统 x86 CPU 的两倍以上。

Arm 的入局尤其值得关注。这是 Arm 三十五年来首次推出自研芯片,直接瞄准 Agent 推理场景。

当 IP 授权商开始自己做芯片,说明它对这个市场的判断已经从 " 趋势 " 变成了 " 确信 "。

一个细节值得品味:在 Agentic 推理中,CPU 的角色正在从 " 数据搬运工 " 升级为 " 调度中枢 "。OpenInfer 的分析指出,经典模型服务是一个大模型运行一个大计算,吞吐量是瓶颈,这是 GPU 最擅长的。

但 Agent 是一个循环:推理一点、调用工具、等待 API、读取文件、运行代码、检查结果、再推理。

这个轨迹是一长串小的、分支的、延迟敏感的步骤,其中大部分只短暂接触加速器,甚至完全不接触。在这些模型调用之间的空隙里,工作是编排、数据移动、工具执行、检索和长上下文状态管理,而这些都是 CPU 的工作。

" 推理花了好几年忘记了这一点,因为工作负载足够单一,GPU 可以假装自己就是整台计算机。Agentic 工作流终结了这种假象。"

这不单只是芯片的事

把视角拉高一点来看,CPU 的身价暴涨,本质上反映的是 AI 产业正在经历一次深层转型。

过去两年,AI 的竞争焦点在 " 模型有多强 ",参数规模、基准测试、榜单排名。GPU 之所以成为绝对主角,是因为训练一个更大的模型确实需要更多的 GPU。

这个逻辑简单直接,资本市场也容易理解。

但 Agent 的到来改变了游戏规则。当 AI 从 " 回答问题 " 转向 " 完成任务 ",衡量标准就不再只是模型在榜单上考了多少分,而是它能不能稳定地、安全地、高效地替用户把事情办成。

这需要任务编排、工具调用、权限管理、状态持久化、多代理协调等,这些能力大部分不取决于模型参数有多大,而取决于底层的计算架构能不能高效地支撑这些操作。

正如伯恩斯坦研报所指出的,如果 CPU 性能不足,GPU 算力将闲置。在 Agent 时代,算力集群的效率不再取决于最强的那个芯片,而取决于最弱的那一环。

这意味着产业的竞争维度正在发生根本性变化。从拼参数、拼概念,转向拼软硬件的综合实力,拼芯片架构的合理性,拼算力配比的均衡性,拼系统调度的效率,拼安全架构的可靠性。

Meta 的 Muse 其实就是一个缩影。它背后是 Meta 自研的 Muse Spark 模型,但支撑它运行的是那台云端虚拟机、是 Sentinel 安全代理、是多代理并行的调度系统。

用户感受到的 " 好用 ",是模型能力、芯片算力、系统架构、安全设计共同作用的结果。

单独拎出任何一个环节,都讲不出完整的故事。

CPU 的回归,并不意味着 GPU 的退场。

在 Agent 的最优架构里,GPU 负责模型生成,CPU 负责任务编排,二者是异构协同的关系。CPU 算力供给不足,会直接导致高端 GPU 资源空转浪费。

真正的变化在于,产业终于开始意识到,AI 算力的故事不能只有一颗芯片。

从 1:8 到 1:1,这个配比的变化背后,是 AI 从 " 炫技 " 走向 " 干活 " 的必然结果。当 AI 真正开始替人做事,支撑它的基础设施必须重新设计。

而 CPU,恰恰是这套新基础设施中最容易被低估、却最不可或缺的那一块。

Muse 的爆火只是一个触发点。它让市场看到了 Agent 的商业化可能性,也让资本意识到,算力受益面正从 GPU 向数据中心 CPU 显著扩散。但这只是开始。

真正值得关注的问题是:当 Agent 从百万用户走向十亿用户,从消费场景走向企业场景,从简单任务走向复杂工作流,我们的算力基础设施准备好了吗?

CPU 的涨价和缺货,或许就是这个问题最诚实的回答。

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容