
作者 | 王涵
编辑 | 漠影
就在上周,Salesforce 正式上线了一批"job-ready"(即用型)长周期智能体。
销售 Agent Hunter 可以跨天、跨周持续跟进一个销售机会——自己做研究、写邮件、调整策略、更新 CRM,直到目标完成或需要人类决策;
客服 Agent Casey 能在语音、短信、WhatsApp、网页等多渠道自主处理问题;还有专门负责线索生成、IT/HR 服务、供应链的 Agent 等等。
进入 2026 年,Agent 成为大热赛道,国内外的办公、生活 Agent 产品如雨后春笋般涌出。Agent 在生活中越来越普及,用户看到的,是 " 一句话就能把复杂工作交给 Agent" 的便利。
而产业看到的,是账单。
国际数据公司 IDC 近期发布《DAA 研究报告》(Daily Active Agents,日活智能体数)。报告显示,2025 年,全球活跃 Agent 数量是2860 万个,预计 2026 年达到7940 万个,2030 年将增长到22.16 亿个。
Agent 全民化的趋势不可挡,但你有没有想过,如此大的吞吐量,Agent 背后到底靠什么支撑?
水面之上,是 " 一句话办事 " 的便利。水面之下,则是芯片、存算、互连、系统、框架、Infra 共同支撑的计算体系。Agent 每一次规划、每一轮推理、每一次工具调用,最终都要落到这套体系上。
最形象的例子就是不久前全球最大开源模型 Kimi K3 的发布,该模型在发布 48 小时内因算力逼近极限,月之暗面暂停了新用户订阅。
Agent 和模型能力飞速进化,其背后的计算体系有四个痛点越来越棘手:
1、Token 消耗巨大,算力成本与稳定性风险
2、芯片架构追不上 Agent 负载的变化
3、芯片多元了,软件怎么协同?系统能力怎么扩展?
4、Agent 进入生产系统,稳定供给和可靠运行没有标准答案
这四个痛点如何解决?行业亟须一个机会,让模型、芯片、存算、互连、系统、框架、Infra 等 Agent 产业链上的每一环坐在一起好好聊聊。
这不,机会来了。
2026 年 9 月 21 日,AICC2026 人工智能计算大会将在北京中关村国际创新中心举行,本次大会设置1 个主会场、7 个分会场,近 60 场专题报告。
届时,来自芯片 / 存算 / 互连 / 系统 / 框架 /Infra/ 模型等领域的专家和学者,将共同探讨" 当 Agent 从一次调用走向持续任务链,下一代 AI 究竟需要怎样的计算体系 "。
一、Agent 越在线,算力越像 " 无底洞 "
据 Gartner 2026 年 3 月报告,一个 Agent 工作流每任务消耗的 Token 量是标准聊天机器人的5 到 30 倍,原因是单次用户请求通常会触发10 到 20 次顺序模型调用。
高盛预测,到 2030 年全球 Token 消耗量将较 2026 年增长 24 倍,达到每月约 120000 万亿 Token;持续在线的智能体每天 Token 消耗可能超过 10 万。

以全球最大开源模型 Kimi K3 为例,该模型总参数量 2.8T、激活参数量 104B。K3 权重文件约 1.56TB,而普通的 AI 服务器,GPU 显存连权重都装不下,更别提百万 Token 上下文,因此官方推荐扩展到 64 卡甚至更大规模才能装得下。
即使装得下,对算力系统显存带宽与节点间通信要求也极高。据 SemiAnalysis 的分析,K3 每执行一次前向计算,仅 HBM 带宽需求就高达约 1.5TB;896 个专家需要分布到多卡上,每次前向传播触发超过 120 次All-to-All 通信。
这意味着,如果互连带宽和延迟跟不上,大量算力就会被浪费在等待多卡之间的数据搬运上。
此外,Kimi K3 采用KDA(Kimi Delta Attention)线性注意力与全注意力相结合的混合架构,需要专门的线性注意力融合算子、分块并行策略以及状态感知的缓存管理机制。未经优化的超节点系统,初始性能可能仅在 10 tokens/s 左右。
万亿参数模型正在让传统 AI 算力系统遭遇瓶颈。

这正是 AICC2026 主论坛上多位嘉宾将要回应的问题。
在系统侧,浪潮信息首席 AI 战略官刘军将回应算力如何从 " 堆得更多 " 走向 " 用得更好 ",通过开放多元的系统架构,以及计算、互连、存储、软件的协同创新,让每一份算力算得其效、算尽其用。
在模型侧,AI Infra 论坛上,由 SGLang 核心维护者主导,将讨论大模型推理的基础设施重构问题。SGLang 核心贡献者张晓雨也将在主会场分析 Agentic Inference 如何通过 Kernel、缓存和调度降低时延与成本。
此外,在OCTC 主办开放超节点论坛上,百度智能云、浪潮信息、曦智科技等将共同讨论国产 AI 硬核底座标准。
Token 工厂论坛上,GPUStack、硅基流动、清程极智、PPIO、积算科技等团队将拆解推理供给的商业闭环。
这些议题共同指向同一个答案——Agent 越在线,算力越不能 " 掉线 "。
面对持续增长的 Token 需求,除了多堆芯片,行业还需要更高效的模型框架、更开放的芯片互连,以及更深入的算子优化等系统创新,把算力转化为更快、更稳定、更低成本的 Token。
二、Agent 负载发生变化,传统芯片遇上两堵墙
Agent 负载变长、并发增加、时延层层累积,传统芯片架构面临" 存储墙 "" 功耗墙 "与制程瓶颈。
传统冯 · 诺依曼架构下,存储与计算分离,数据在两者之间来回搬运,功耗和时间大量消耗在搬运路上。而 Agent 负载恰恰对这一点格外敏感。

Agent 所承载的工作越来越复杂,芯片的能力开始触及边界,行业也开始探索更多新架构来扩展芯片能力。
例如,北极雄芯创始人 & 首席科学家马恺声就将在大会上拆解 Chiplet 与 3D 集成如何拓展芯片能力边界。
北京开源芯片研究院和智源联合主办的 AI 芯片论坛,将阿里达摩院、摩尔线程、中科院计算所等机构聚在一起,共同思考:当摩尔定律逼近物理极限,除了把晶体管做小,从材料、架构、封装等多个维度,芯片还有哪些新的可能?
三、硬件路线越来越多,系统却越来越难统一
芯片架构正在从单一走向多元——存算一体、Chiplet、3D 集成,每条路线都在试图接住 Agent 带来的复杂负载。
但一个问题随之出现:不同芯片有各自的软件栈和生态,应用要在多种硬件上运行,迁移和适配成本居高不下。
芯片路线越来越多,怎样才能进入同一个系统,形成整体能力?硬件路线越来越多,软件如何协同,不同芯片又怎样形成可扩展的系统能力?
这个问题不仅存在于技术层面,它更是一个决定 Agent 能否规模化落地的产业问题。
主会上,北京智源人工智能研究院副院长兼总工程师林咏华将讨论硬件越来越多元,软件如何让不同芯片真正协同起来。
她主导的 FlagOS 项目,正是一个面向异构 AI 芯片的开源统一系统软件栈,目标是 " 一次开发,多芯运行 ",目前已支持 18 家厂商 32 款芯片。
在这条路径上,软件栈扮演的是 " 翻译层 " 的角色——让上层应用不必关心底下跑的是什么芯片,让不同架构的芯片都能进入同一个系统。
四、Agent 要 " 持续办事 ",可靠性、评价尺度、企业落地谁来管?
在进入消费者生活的同时,Agent 也 " 打 " 入了企业内部。
在企业中,Agent 更要持续在线、稳定执行,企业级落地对其算力能力、使用成本与稳定供给提出了新要求。
据网易有道 LobsterAI 发布的《中国办公 Agent 用户行为不完全报告》,办公 Agent 单次任务规模在 5 个月内增长 3.1 倍,8 月环比增幅高达 53%,用户正在将更加复杂、长周期的深度工作托付给 Agent。

Agent 时代,哪些行业正在率先把 Agent 能力转化为业务价值?Agent 的能力又该如何衡量?这正是 AICC2026 两个重磅发布仪式的意义所在。
在大会上,IDC 与浪潮信息将联合发布《2026 中国人工智能计算力发展评估报告》,这是业内首份 Agent 基础设施算力研究报告,将系统呈现面向 Agent 时代的 AI 基础设施变革与重构,并揭晓 2026 年度中国 AI 算力城市最新排名。
另外,一套覆盖 " 芯片—框架—模型—应用 "的 AI 测评体系也将同期重磅亮相,填补国内 AI 第三方评测空白。
AI Work 论坛上,Datawhale 主办,Dify、记忆张量、平凯星辰、商汤等团队将讨论智能体从技术创新到企业级落地。
Agent 要真正进入日常和生产,不能只靠 " 能跑 ",还要 " 可靠地跑、算得清账、评得出价值 "。
结语:看懂中国 AI 计算的下一步,听 AICC2026 这一场大会就够了
智能体正在从技术创新走向产业实践,计算体系也随之从后台支撑变为决定 AI 能否规模化、可持续、可负担的关键变量。
产业需要的,或许不仅是某一层的单点突破,而是芯片、系统、软件、应用之间更紧密的协同演进,以及开放、多元、可验证的产业生态。
如何突破?如何协同?新 AI 时代需要的是怎样的计算系统?这些问题的答案,都可以在 AICC2026 人工智能计算大会上找到。
大会完整议程:
