关于ZAKER Skills GEO服务 合作
硅星人 37分钟前

高通的好日子还在后头

" 手机哪儿都不会去(Your phone isn ’ t going anywhere)。"

在今年的高通骁龙峰会上,高通公司总裁兼首席执行官安蒙(Cristiano Amon)直抒胸臆。对于今天所有人都在关心的 Agent 浪潮如何冲击手机的话题,他给出了直接判断。

他认为,手机过去 20 年都在围绕 App 展开,现在则是 Agent 的时代。但 Agent 不会让手机不再重要,反而它只会让手机以及更多端侧设备变得更重要。

当然,这些机会属于围绕 Agent 重塑的设备。在今年声势浩大的骁龙峰会上,高通就想告诉全世界,它是手机和各类终端拿到 Agent 时代船票的绝佳伙伴,甚至是它们的一条必经之路。

重塑旗舰芯片

这次峰会上,高通少有的首次同时发布了两款骁龙 8 至尊版平台:第六代骁龙 8 至尊版和第六代骁龙 8 超级至尊版。两者都采用 2 纳米工艺,搭载新一代自研 Oryon CPU,配备 2 个超级内核和 6 个性能内核,其中超级内核最高主频达到 5GHz。高通称,这是智能手机 CPU 首次达到这一频率。

两款芯片的 CPU 架构和频率相同,GPU、NPU 也采用相同的基础架构。区别在于,超级至尊版进一步支持 LPDDR6 内存,在 GPU 中加入 Matrix Cores 矩阵计算核心,提供更强的 NPU 配置,并采用新的 Offset PoP 封装。8K 60 帧视频拍摄、4K 240 帧慢动作等更高规格的影像能力,也集中在超级至尊版上。

" 单一标准,已经无法定义旗舰。" 高通高级副总裁兼手机业务总经理 Chris Patrick 说。标准旗舰、Ultra、折叠屏,对影像、性能和成本的要求各不相同。至尊版接续上一代旗舰,超级至尊版承接更多前沿能力,这个很容易让人想到必胜客披萨的中文译名,也的确像披萨一样,不同口味满足不同需求,高通由此给终端厂商留下了更细的选择空间。

两款新品共同面对的变化,则比产品分档更深。Agent 要读懂用户要求、调取信息、规划步骤、调用工具,再根据执行结果继续行动。一件事可能要经过多轮推理和操作,手机需要为整段工作流程服务。

安蒙把这称为 " 一次对系统级设计的挑战 "。从计算单元怎样分工,到数据存在哪里、如何传递,再到电池能否支撑持续运行,整个平台都要随之调整。

这个系统工程的第一步,是要让推理和执行接得起来。过去的 AI 算力讨论更多围绕 GPU、NPU 展开,但最近越来越多人意识到,Agent 也在提高 CPU 的重要性。

模型生成计划之后,系统要执行程序、检索文件、调用服务,并调度不同计算单元。前一步没完成,后一步往往只能等,整个任务的响应速度因此也取决于 CPU 处理这些环节的效率。最近走红的 Meta 个人 Agent Muse,就在专属云端虚拟机中运行浏览器、调用服务,带动了市场对服务器 CPU 需求的预期。模型推理之外的执行负载,也开始受到重视。

" 完整的任务编排调度仍然由 CPU 来完成。" 高通执行副总裁马德嘉(Durga Malladi)说。史无前例的 5GHz 的意义也就在这里:配合缓存和调度优化,让一连串操作更快衔接起来。

NPU 则要处理越来越复杂的模型与上下文。超级至尊版的 Hexagon NPU 引入 Hexagon Element Accelerator,支持最高 32K Token 上下文窗口,实际可用长度还取决于模型和内存配置。按高通公布的数据,在部分模型上,预填充性能较前代最高提升 80%。预填充就是模型开始输出之前,先处理输入材料的阶段。Agent 面对的输入可能包括邮件、文件、日程和工具返回的结果,这一步的效率,影响着它读完材料、开始行动要等多久。

GPU 也有了新的分工。超级至尊版新增 Matrix Cores,使 AI 模型可以更紧密地融入图形管线,支持 Adreno Neural Fusion 的超分辨率、帧生成等功能。按高通公布的数据,相比第五代骁龙 8 至尊版,新 GPU 的性能与能效分别最高提升 44% 和 40%。

这类能力同时也向通用 AI 任务开放:开发者可以把模型的一部分放在 NPU 上,另一部分放在 GPU 的矩阵核心上,按照工作负载选择执行方式。资源更多了,任务分配与数据传递也就更重要。

这些计算单元还需要及时拿到数据。

这一代 Oryon 引入了 FlexCache,让 8 个 CPU 核心访问同一个 16MB 共享 L2 缓存池,并按需分配资源。缓存是离计算核心很近的临时工作空间,用来保存近期可能反复使用的数据。Agent 不断切换任务,不同核心之间也要交换数据,共享缓存能够降低这些交接的成本。

" 我们不会单单依靠缓存大小来评判 CPU 子系统。" 高通在介绍 FlexCache 时,重点也放在异构核心能够以低时延访问同一个缓存池。过去看芯片升级,人们习惯先数多了多少核心、多少 MB 缓存;现在,数据能否在不同核心之间高效流转,同样决定性能。

NPU 的调整也遵循这条思路。超级至尊版将 NPU 的片上共享内存(SRAM)容量增加 50%,让更多运算中间数据保存在片上。高通解释,模型运行时会产生大量激活值和中间结果,如果反复从外部内存搬到计算单元附近,功耗就会增加。GPU 的 HPM 独立高速显存也是片上存储:Adreno Neural Fusion 的卷积运算输出可以留在这里,减少对外部 DDR 内存的访问。

这些存储位置各有用途,共同目标是减少数据往返。计算单元越来越快以后,等待数据的时间和搬运数据的能耗,就会变得更加显眼。

另一个问题是容量。MoE 混合专家模型每次只激活部分专家参与计算,整个模型的参数却仍然需要地方存放。手机的运行内存还得留给系统和应用,很难任由模型占满。因此,高通将 UFS 5.0 与闪存到内存的管理结合,让较大模型可以把权重存放在闪存、按需加载到运行内存,降低全部常驻的压力。这也意味着更多权重读取,对存储带宽和调度提出了要求。

此外,常见的 Transformer 模型还要用 KV Cache 保存此前 Token 的部分注意力计算结果,减少重复计算;较长的上下文通常会占用更多这类工作内存。把权重放进闪存,也不能消除这部分需求。

再往后,高通准备把 HBC,也就是 High Bandwidth Compute,高带宽计算,带到终端。它把堆叠式 DRAM 放在带有计算逻辑的裸片之上,让部分计算更靠近数据。HBM 的典型方案是让高带宽内存向独立加速器供给数据,HBC 则进一步调整计算发生的位置,尽量减少搬运本身。

这是一条后续技术路线,两款新芯片尚未宣布搭载。安蒙预告,下一届 MWC 将公布更多进展。他预计,未来某些 Agent 终端每天可能在本地处理多达 100 万个 Token,同时仍要保持全天可用。上下文、推理步骤和调用次数继续增加,内存容量、带宽和能效就会越来越难绕开。

让这套系统持续工作,还要处理待命功耗和散热。

想让 Agent 主动提供帮助,系统就要持续了解用户的情境,又不能为了随时待命,让主要计算单元一直高负荷运转。新一代传感器中枢采用双 Micro NPU 架构,高通给出的代际性能提升为 85%,功耗降低 20%。它以低功耗处理语音、活动和环境信号,减少频繁唤醒主处理器的需要。

基于这套架构,Personal Scribe" 个人记录 " 可以按照用户指示,为对话建立索引、区分发言者,把重要信息整理进个人知识图谱。相机也开始提供更多上下文:Spectra ISP 与 NPU 协同,识别人脸、物体和画面中的不同区域,让视觉信息能够被 AI 使用。

这些信息还要在设备与云端之间流转。X105 调制解调器及射频系统、面向 Wi-Fi 8 设计的 FastConnect 8800,承担着更高吞吐量、更低时延的连接需求。眼镜采集画面,手机处理信息,复杂任务调用云端,每一段连接的质量都会影响 Agent 能否顺畅完成工作。

甚至连内存与处理器在封装中的相对位置,也需要改变。超级至尊版的 Offset PoP 重新安排两者的位置,为热量离开处理器提供更有效的通路,以改善高负载下的持续性能。

从任务编排,到数据供给,再到持续感知和运行,高通正在按 Agent 的工作方式重做手机平台。AI 带来的新要求已经落到了整颗芯片的各个部分。

Agent 在哪里,高通就在哪里

高通认为,Agent 会让手机更加重要,背后一个重要原因是手机已经把个人信息、计算和服务连接集中到了一台随身设备上。

Chris Patrick 将它的优势归纳为三点:随身、情境感知、连接。它一直跟着用户,能够获得与用户相关的信息,又连接着应用、其他设备和云端资源。高通因此将手机定义为 " 智能体时代的控制中心 "。

一个模型可以知道世界上很多事情,但替你安排今天的生活,还得知道你在哪里、接下来要见谁、刚刚答应了什么。用户每次都重新交代一遍,助手就很难省事。设备中积累的这些信息,决定了通用模型能够在多大程度上成为个人 Agent。

而人也不会整天只使用一部手机。电脑知道工作进行到哪一步,眼镜可以获得眼前的视野,耳机适合接收语音,手表贴近日常活动。不同设备各自补充信息,手机则可以提供相对充足的算力、电池和应用连接。用户少掏几次手机,背后的手机可能反而更忙。

跨设备的难点,是上下文不能随着换设备而中断。马德嘉举例,用户先拿手机工作一小时,再换电脑工作两小时,两台设备各自积累的信息,需要共同服务于同一个人。高通正在与终端厂商、云服务伙伴协作,让个人上下文跟着用户走。这需要芯片、软件和服务一起完成。

" 你不应该仅仅因为从手机切换到了车内,就需要重新向系统介绍自己。"Google 设备与服务负责人 Rick Osterloh 说。Google 正在通过 Gemini Intelligence,为传统操作系统增加智能层,并将这些能力扩展到手机、电脑及其他终端。与高通的合作,则要让本地模型和云端处理协同,同时满足终端的算力与散热约束。

与此同时,一部分交互也可以绕过手机。峰会第二天,高通发布第二代骁龙音频平台至尊版:相比前代,平台尺寸缩小 30%,计算和 AI 性能提升至两倍,并集成蓝牙与超低功耗 Wi-Fi,支持耳戴设备通过 Wi-Fi 直接连接云端服务与 Agent。

配套的 " 骁龙畅听应用与智能体 ",还让服务商能够直接面向耳戴设备部署应用,产品上市后继续增加功能。耳机由此有机会从手机的音频配件,发展出自己的服务入口。对于高通,计算发生在耳机里、手机里,或两者之间分工,都对应着它能够提供的平台能力。

眼镜需要解决的则是另一组限制:空间更小,电池更小,还得戴得舒服。高通与 PrismML 合作,让第一代骁龙 AR1 和 AR1+ 支持多模态 1 比特模型,通过更紧凑的权重表示减少内存占用。以现场展示的 20 亿参数 Bonsai 视觉语言模型为例,17 亿参数的语言部分采用 1 比特权重,3 亿参数的视觉编码器仍采用 4 比特。实时翻译和视觉辅助等能力,也因此有机会在更小的设备上直接运行。

硬件与模型逐步具备条件之后,还要有人把它们做成用户愿意买的产品。骁龙 START 计划提供 AR1+ 小型模组、眼镜端软件、手机配套应用、云端连接,以及制造与定制资源。品牌可以选择不同模型,高通则尝试用统一的记忆体系,让模型切换之后仍保有连贯的用户上下文。

英国眼镜公司 INSPECS 的现场展示引人注目。这家公司原有的镜架业务覆盖全球 7.5 万家眼镜和零售门店,与高通合作的一项产品,是具有摄像头和免手持辅助能力的安全眼镜:工人不用放下工具,就能拍摄检查画面、接受远程指导。

对高通而言,这类拥有产品经验和销售渠道的企业,都可能成为新的客户。Agent 拓展到更多生活和工作场景,会带来新的终端形态,也会让原有设备需要更多计算、感知和连接能力。手机的重要性可以继续增加,高通的机会却已经不止于手机。

把支撑最前沿智能的计算做到最小硬件单元里

2023 年,高通已经展示在终端运行 70 亿参数的 Llama 2,围绕用户意图提供 AI 服务的设想也早已出现。但那一代模型与今天能支持的任务,相差很远。" 我认为当时的模型能力尚不足以支撑这些构想落地。" 马德嘉说。

如今模型能力进步,能够建立在其上的 Agent 应用才随之增加。马德嘉也将衡量端侧 AI 的重点放在模型质量和实际能力上,包括多轮交互的准确率、任务复杂度,以及能否在 Agent 工作流中发挥作用。模型进步,为高通原有的计算、内存和感知技术积累找到了更明确的用途。

在这些 " 家底 " 基础上,高通还在补强软件一层。今年 7 月,高通完成对 Modular 的收购,投入包含 Mojo 编程语言、MAX 推理平台在内的软件栈,并继续推动它适配包括第三方芯片在内的多种硬件。安蒙的目标是,为开发者提供一种统一的方式,在不同计算环境中构建和优化 AI。少一些重复适配,各种设备里的计算资源才更容易被调用。

回头看,高通一直在解决类似的问题:把先进的计算能力,连同通信、感知以及软件支持,放进尽可能小的硬件单元,让它成为人们可以随身使用的东西。早期骁龙要把手机变成一台计算机,用 1GHz 级处理器运行完整操作系统,同时维持全天续航;今天,这台设备又要承担持续运行的 Agent。

" 手机必须能够装进口袋,不能发烫,而且电池要能够支撑一整天的使用。" 安蒙说。模型越能干,这些限制越需要认真处理。眼镜、耳机等更小的设备,还会把同样的难题再推高一层。

当然,平台能力需要被产品兑现。终端厂商要考虑成本,用户要考虑续航、舒适度,以及把个人信息和行动权限交给 Agent 之后,能不能真的省事。高通还要面对其他芯片平台和客户自研芯片的竞争。" 使用智能体必须比你自己动手更简单 ",安蒙给出的标准,最终也会决定这些新硬件是否有足够的购买理由。

但当 Agent 能够稳定接过越来越多的工作,先进计算所要进入的设备和场景也会继续增加。从用户偶尔唤起一次 AI,到 AI 持续为用户工作,设备需要支持的计算量、数据流转和协同程度,都可能大不相同。这有可能成为高通自智能手机普及以来,最大的一次机会。

Agent 会成为主角,手机仍有它的工作,高通也有机会随着这些任务走进更多设备。让先进的智能成为人们随身可用的东西,高通的好日子,还在后头。

硅星人

硅星人

硅是创造未来的基础,欢迎登陆硅星球。

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容