过去一年,AI 编程和办公工具在 PC 端快速普及,但手机上的 AI 体验仍以单次问答和图片处理为主。高通今年想证明的是——端侧 AI 也能进入到更多生活和工作场景了。
2026 年,骁龙峰会上,高通与阶跃星辰、无量火科技、江波就演示了一个典型案例——端侧 30B-MoE 模型完成的工作链条:仅仅用本地的模型,AI 读懂一封邮件,提取行程信息,同步日历,推荐航班和酒店,再草拟一封回复。
特别之处在于,这是一段需要理解、规划和连续执行的任务,并且完全在端侧完成。

如果说两年前高通主要在证明大模型能装进手机,今年它更想证明,装进去的模型能够承担更完整的工作。
2024 年,高通自研 Oryon CPU 开始搭载在手机上,展示了端侧大模型的可能性;而在 2025 年,第五代骁龙 8 至尊版引 Personal Scribe 和个人知识图谱,将直接智能体写进产品方向。
到了今年,AI 界的新故事进入到以 Claude Code 为主的代码和办公大战。现在,高通开始让旗舰芯片进入 2nm 双旗舰、30B-MoE 部署和更完整的任务流程,这都意味着能够共同和模型、infra 厂商拓展新的应用场景。
" 智能体 AI 并不仅仅是为终端新增一个功能。它实际上创造了一种全新的终端工作流程。" 高通公司总裁兼首席执行官安蒙(Cristiano Amon)在主题演讲中表示。
但当 AI 从一个功能变成一段工作流程,高通要解决的也不仅仅是是让下一代芯片更快。智能体需要更强的本地能力,也依赖快速更新的模型、应用接口与终端协作。
进入 2026 年,芯片厂商们的一个共同趋势是:能力边界在扩大,竞争边界同样在扩大。对高通而言,这种扩展不只是从手机走向 PC、眼镜、汽车和数据中心,还包括围绕模型适配、软件工具和跨终端协作补齐能力。
从让手机部署模型,到让智能体持续工作
如果为今年的骁龙峰会总结唯一的关键词," 智能体 " 绝对排在第一位。高通的一切更新——都是在为更复杂的 AI 任务,重新分配手机里的计算资源。
比如,第六代骁龙 8 至尊版与超级至尊版双旗舰,均采用 2nm 工艺。搭载了超级至尊版的设备,高通不只是把频率拉到 5GHz,其中 CPU 负责工具调用和任务调度,NPU 承担模型推理,低功耗感知单元处理后台信息,为不同类型的 AI 工作分配专属计算通道。
这背后的变化是,AI 不再只在用户提问时工作,还要在后台保留信息、等待时机并接续任务。在以往,一次问答或修图是单次调用;智能体则要反复读取上下文、调用工具、在任务间切换。
缓存、内存带宽和低功耗感知,因此变得重要了——最起码,手机不能因多了一个常驻智能体就持续发烫、迅速耗电。
这并不是今年才出现的方向。2025 年发布的第五代骁龙 8 至尊版,就已经已强调 Personal Scribe、个人知识图谱和低功耗感知中枢。
而在今年,高通在缓存、NPU 共享内存和感知能力上的升级,更像是对既有方向的持续补强——让更多信息得以保留,让任务切换与持续运行更可靠。
不过,这并不是把所有 AI 计算留在本地,而是让终端承担更有价值的一部分。手机掌握日历、邮件等个人信息,高通的新双 Micro NPU 架构性能提升 85%,同时功耗降低 20%,直观提升了个人记录(Personal Scribe)能力——提升本地处理低时延、离线可用和减少数据上传的潜力;复杂任务仍可调用云端。
如今,更大体量的模型开始与完整的本地办公流程结合。对比 2024 年,最多 7B 的模型能够部署在端侧,在这次峰会上,高通就已经和阶跃达成合作。如今,30B 的 MoE 模型在参考设计上完成的邮件理解、行程规划和日历同步,是一次可感知的跨越。

而更复杂的 AI 应用,如今也可以由多个模型的分工完成,而不只是一个模型变得更大。这为应用生态创业者提供了空间。
比如,在 AI 公司 Deepgram 展示的 AI 播客应用中,NPU 上的语音模型负责转写并区分发言者,GPU 上的 Gemma 模型理解话题、生成追问建议——一边听清谁说了什么,一边判断接下来该问什么。这让 " 异构计算 " 变成了读者可理解的场景。不过工作人员也提到需联网检索核查,整个应用并非完全离线。
AI 智能眼镜也是一个典型品类。过去一年的变化,也能说明高通这样的芯片厂商,如何让新 AI 硬件逐步突破能力上限。2025 年 6 月 AWE 上,高通 AR1 芯片的升级款骁龙 AR1+ Gen 1 已用原型眼镜演示 Llama 3.2-1B 本地运行,高通强调芯片更小、功耗更低以适应镜腿和电池约束;今年,高通则进一步为 AR1、AR1+ 对提供多模态 1 比特模型的支持。
高通也在逐步拓展对开发者生态的支持。今年推出的高通 START 计划中,就提供 AR1+ 模组、软件平台和参考设计——非科技厂商的集成门槛也在降低,判断是研发支持越来越贴近品类需求,而非只把手机芯片缩小。
除此之外,高通也推出了全新的 Adreno Neural Fusion,带来增强的移动游戏,借助 AI 实现智能的图形渲染,从而带来更沉浸的游戏体验、更丰富的视觉效果,和更持续的游戏时长。

但芯片能支持什么,与智能体最终能替用户完成什么,仍然不是一回事。高通公司中国区董事长孟樸对 36 氪表示,跨终端持续服务的个人智能体,可能到 2027-2028 年,才会比较稳定地开始逐步落地。
AI 时代的芯片厂商:迭代更快,挑战更多元
高通在 AI 时代,如今的状态可以说是四面开战,压力并不小。这一部分来自新市场的吸引力,另一部分来自也要守住旧市场的压力。
移动时代,成就高通的基础是通信专利与芯片平台两条业务。而进入大模型时代,以数据中心为主的庞大需求,已让英伟达获得庞大收入—— 2027 财年,英伟达第二季度数据中心收入达 890 亿美元。
高通也没有放过这个市场。此前,高通提出 2029 财年非手机收入 400 亿美元的目标,并推进数据中心业务。动机不难理解:守住手机之外,还得找到新的增长引擎。
但在争取新增长之前,高通可能首先得适应一个比手机换代更快的模型市场。" 过去,智能手机完成适配后,可能 9 个月甚至 12 个月都无需再调整;而现在,大模型每 3 个月,甚至更短时间内就会迭代一次。" 高通公司中国区董事长孟樸对 36 氪在内的媒体表示。
模型版本和能力更新快,不代表底层计算结构以同样速度完全变化。更准确的挑战在于:在相对稳定的计算基础上,用软件调度、可配置能力和持续验证承接快速迭代。
更深的一层变化是,合作正从模型发布后的适配,前移到模型设计环节。2026 年展示的四方合作的分工说明了这一点——高通提供计算平台,阶跃提供模型,无量火优化推理与调度,江波龙处理存储协同;AI Hub 则试图复用优化成果、降低部署门槛。
竞争新的竞争指标是:新模型出来后,谁能更快、以更可控的成本交付可用体验。
端侧智能体是整个市场都在追逐的机会,9 月,几乎所有主流厂商的新品都覆盖了端侧和智能体。比如,9 月 15 日,联发科发布天玑 9600 系列,9600 Pro 同样采用 2nm,强调低功耗常驻感知,宣称支持 30B-MoE 端侧运行。
更复杂的竞争也会来自客户一侧:一边采购高通芯片,一边也在把关键能力试图掌握在自己手中。比如小米玄戒 O1 进入量产,苹果在 iPhone 16e 上推出自研 C1 基带等等。而进入数据中心,也绕不开客户与竞争对手身份重叠的局面。英伟达之外,谷歌自研 TPU 也在争取训练和推理负载——而谷歌在终端上又是高通的重要合作伙伴。
当竞争同时发生在多个市场,高通还必须回答一个实际问题:这些新能力,客户负担得起是前提,但如何真正高效地应用起来?
孟樸提到:" 随着技术的进步,芯片中需要叠加的技术越来越多,成本也会因此越来越高。" 在他看来,一款产品展示当前技术能够达到的上限,另一款则更注重效率,以应对高成本、支持终端厂商。技术能力向前推进,能否被客户采用仍要过成本这一关。
至少,让智能体稳定地在移动设备上运行,还有多重挑战。" 不能做错任务,不能过度占用内存,还不能增加续航负担,起码不能比手动操作还慢。" 一位半导体行业人士总结。
现在,芯片行业正在进入多线混战。高通需要守土开疆,还必须成为耦合大模型厂商、AI 应用之间的长期协作者。对高通来说,下一轮胜负不只取决于它能把多大的模型装进终端,更取决于能否让不断变化的模型,及时变成用户愿意反复使用的产品。