关于ZAKER Skills GEO服务 合作
雷锋网 50分钟前

GMIF 2026:日均 140 万亿 Token 调用,正在改变 SSD 的能力与分工

作者 | 陈悦琳

编辑 | 包永刚

HBM 热潮之外,其他存储形式也站在风口。

这是今年第五届 GMIF2026 全球存储器行业创新峰会释放的第一个明显信号。以全球云数据中心资本支出为例,摩根士丹利执行董事、大中华区半导体分析师颜志天指出,在未计入 HBM 的情况下,2026 年存储占比接近五成,2027 年预计进一步升至 53%。

热钱涌向存储,背后是前所未有的推理需求增加。截至今年 3 月,中国日均 Token 调用量已突破 140 万亿。对此,三星电子副总裁、Memory 事业部首席技术官 Kevin Yoon 做了一个简单换算:中国每天消耗的 Token,是中国国家图书馆全部藏书对应 Token 量的 20 倍以上,也接近人类历史上所有出版图书总量的 6 倍。

面对 140 万亿量级的推理负载,存储要应对的不只是数据量的增长,还有不同数据在访问频率和生命周期上的巨大差异。这意味着不同存储介质需要为此补齐各自在容量、带宽、时延和耐久性上的短板。

除此之外,Solidigm 亚太区销售副总裁倪锦峰还在现场提到,以前存储成本较低时,行业倾向于尽量简化存储层级;随着 AI 数据需求快速增长和成本压力加剧,原有的 " 存储金字塔 " 也在被进一步细分。

规模化推理下,三重压力「夹击」存储

当 AI 的发展阶段从训练端的模型竞赛进一步走向推理侧的规模化应用后,存储面对的压力也更为具体。倪锦峰将其概括为三个维度。

最直观的是数据丰富度。星河智联现场展示的车载 Agent,可以用来说明 AI 系统如何同时处理和保存多模态数据:除了理解语音、视觉、车辆信号等不同形式的信息之外,Agent 还要结合对话历史、长期记忆、用户画像以及实时变化的车身状态完成判断。

这意味着数据丰富度不只体现为数据形式和数量的增加。不同数据的来源、形态和更新频率各不相同,直接导向第二层压力——推理复杂度。

Arm 全球存储业务负责人 John Xavier Lionel 对推理数据的拆解恰好解释这一维度:模型变大,会带来更多权重和运行时状态;上下文越长,需要为后续 Token 生成保留的 KV Cache 也在增加;同时服务的用户越多,系统还要为每个请求分别保留 KV Cache;进入逐 Token 生成的 Decode 阶段,模型权重和 KV Cache 还会被反复访问。

而当推理模式从一次性问答转向持续运行的 Agent 时,单个任务持续时间被拉长,随着任务规模扩大,需要长期维护的上下文和运行状态也不断累积,这也引出了倪锦峰所说的第三个维度 " 运营持久性 "。

Dify 联合创始人陈璐莎判断,未来企业运行的 Agent,数量可能将从个位数上升至数百个,并且能够 24 小时待命、执行长程任务和承担高并发请求。

这种持续运行,也对应不同的企业 AI 服务模式。例如并行科技提供的 MaaS(Model as a Service,模型即服务)模式允许企业通过 API 持续调用不同模型并按 Token 付费。这意味着服务商需要持续保障模型调用的首 Token 时延、成功率和吞吐量,并监控调用费用;

针对企业本地 Token 工厂的建设规划,相比追求峰值性能,联想更关注算力资源的实际利用率、服务运行的稳定性,以及最终能以多低的成本持续产出 Token。

当 SSD、HDD 和 NAND 开始「越界」

当数据、推理和运营三种因素的变化进一步叠加,存储容量扩张、带宽提升、时延降低、耐久性保障等多重挑战随之袭来,不同存储介质自我能力的提升变得更加紧迫。其中,变化最明显的当数过去更多负责大容量和持久化存储的 SSD,目前多家企业已经从多个维度展开升级。

不同任务正向同一款 SSD 提出不同的性能要求。以 Agent 的工作环节为例,规划阶段强调低时延、检索阶段要求高吞吐,执行阶段则更指向高带宽。对此,慧荣科技通过主机软件和存储软件栈识别任务类型,再由 SSD 控制器按 QoS(Quality of Service,服务质量)等级调整资源配置,使同一块 SSD 能够响应不同 AI 负载。

SSD 不只是在内部做差异化分配。结合存储与计算单元之间的距离,闪迪资深产品市场总监张丹将 SSD 拆成三类:直接连接 GPU 的 SSD 主要承接热 KV 等高频访问数据,为计算持续 " 备料 ";通过网络连接 GPU 的 SSD 仍然服务计算,但部署规模可以更大;位于计算集群之外的存储型 SSD 则更强调容量,主要承载不需要被频繁访问的数据。

SSD 向上承接更多靠近计算的数据之外,也在向存储金字塔的下层延伸。据倪锦峰观察,为了减少机房空间占用和功耗开销,北美大型互联网公司已经开始用大容量 QLC SSD 替代部分 HDD。

当然,这并不意味着 HDD 的影响力式微。定位于传统 HDD 与企业级 SSD 之间,大数极限设计的 PMD 试图在传统机械硬盘基础上通过多路并行、扩大 I/O 请求队列,并结合请求聚合、预取和缓存等方式提高存储带宽和随机访问能力。

工作负载的变化也影响了 SSD 的测试环节。传统 SSD 测试常以固定 4K、128K 数据块进行读写,而 AI 负载会出现突发、高并发等更加复杂的 I/O 行为。欧康诺因此在 AI SSD 测试中加入深度学习 I/O 负载,以及 KV Cache、断点恢复等场景。

更值得注意的是,构成 SSD 底层介质的 NAND,本身也在沿着不同方向突破原有的能力边界。

一种思路是直接提高 NAND 器件本身的性能。在意识到端侧推理向 DRAM 施加的成本压力后,三星设计的 Z-NAND,其核心 Die 基于 SLC(Single-Level Cell,单层式存储),并集成 TSV(Through-Silicon Via,硅通孔)等技术提高读取性能。在 Kevin 展示的架构中,操作系统和 KV Cache 仍留在 DRAM,大容量、读取密集的模型权重则被放入 Z-NAND。

另一种思路则将 NAND 升级成为 HBF(高带宽闪存)。据北京大学集成电路学院院长蔡一茂介绍,目前主要有两条技术路径:一条从 NAND 阵列本身入手,通过缩小阵列尺寸降低读取时延;另一条则借鉴 HBM 提高并行度的思路,通过增加接口数量来提升带宽。他同时指出,尽管两种方案都在试图补足传统 NAND 读取速度和带宽的短板,但仍需要解决如缩小阵列会牺牲部分存储密度、NAND 的读取时延仍然偏高、有限的写入寿命难以承受 KV Cache 等数据的频繁更新等问题。

更加激进的 NAND 变化体现在从存储继续向计算延伸。蔡一茂提到,当前北大和燕芯微等合作伙伴正在探索利用 NAND 阵列直接完成部分存内计算,减少数据在存储和计算单元之间的往返。

数据分层管理从「兜底」走向主动调度

传统存储层级建立在速度、容量与成本的权衡之上:越靠近计算单元,速度越快、容量越小、单位成本越高;越向下则相反。这套分工能够长期保持稳定,也与不同数据相对固定的访问需求有关。

如今,软硬件都在发生变化。一边是存储载体自身的能力边界不断外扩:从存储 " 金字塔 " 层级出发,SSD 同时向计算侧存储和大容量存储侧延伸,更靠近塔底部的 HDD 试图向更高性能靠拢;聚焦具体存储介质,NAND 进一步向高带宽乃至计算能力拓展。

另一边,AI 带来更多类型的数据,同一份数据的访问频率和生命周期也会随着计算过程不断变化。原本相对稳定的数据与介质对应关系由此开始松动。

在多位与会嘉宾看来,数据跨层移动本身并不是 AI 时代的新现象,真正的变化在于,数据管理正从 "HBM 不够给 DRAM、DRAM 不够给 SSD" 的兜底式分层,转化为系统设计之初的主动分层和运行过程中的动态调度。

芯展速副总裁李蓁进一步用三个关键词拆解了当前 AI 数据供给体系:存储决定什么数据由什么介质承载,连接负责数据稳定、高效地流动,解决方案则通过软件完成调度和应用适配。

而联芸与寅谱联合推出的 AI SSD 方案则将这种分工落到了推理运行过程中。针对 MoE 模型参数,当前需要调用的专家权重留在 CPU 内存和 GPU 显存中,暂时不会被调用的权重则放入 SSD。考虑到 SSD 访问速度更慢,系统还会预测下一阶段可能调用的专家,提前将相应模型和参数预取回来。针对 KV Cache,高频访问的留在内存,低频部分则下沉到 SSD。

把范围从单个计算节点放大到整个算力集群,杰创智能搭建的常青云平台还进一步大同 " 数据——存储——计算 " 的链路,提前把任务所需的数据准备到相应节点,并结合任务类型、GPU 代际和网络带宽等信息,将数据与合适的算力资源匹配起来。

这也呼应了佰维存储董事长孙成思在现场的判断—— " 数据供给的效率决定算力的产出 "。当 AI 推理走向规模化、高并发和持续运行,存储最终要回答的,已经不只是数据放在哪里,还有如何让数据及时抵达算力。

雷峰网雷峰网

相关阅读

最新评论

没有更多评论了
雷峰网

雷峰网

读懂智能&未来

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容