
按照传统的大模型工作方式,每一个请求 GPU 都要把系统提示词和历史对话重新计算一遍。这意味着,宝贵的算力被浪费在了 " 算已经算过的东西 " 上。
随着大模型从实验室走向生产环境,一个曾经只属于学术讨论的话题被推到了产业前台:推理已经成为吞噬算力的黑洞。
推理时代的 " 显存墙 "
大模型推理的过程,简单来说分两步。第一步是 Prefill(预填充),模型把用户的问题 " 读懂 ",生成一堆缓存(也就是 KV Cache)。第二步是 Decode(解码),模型一个字一个字往外蹦答案。问题在于,多轮对话里大量的问题是重复的,每一次重新 Prefill 都是在浪费算力。
所以业界早就形成了一个共识:用存储空间换计算时间,把重复生成的 KV Cache 存下来,下次直接调取。听起来很合理,但执行起来遇到了一堵实实在在的墙,那就是 " 显存墙 "。
GPU 的 HBM(高带宽内存)容量有限,且成本很高。KV Cache 随着上下文长度和并发请求数线性增长,很快就能把显存撑爆,对此,中科曙光分布式存储产品部总经理石静告诉我们,KV Cache 在推理过程中的内存开销可以达到数十乃至数百 GB,远超单张顶级 GPU 的显存容量。显存一满,GPU 算力再强也转不动,新的请求进不来,正在处理的请求开始卡顿。
东方证券在行业深度报告中判断,AI 算力中心的核心挑战已从之前算力为主,逐步转向存储与带宽为主。无独有偶,SEMI 中国总裁冯莉在今年 3 月的演讲中披露,2026 年全球 AI 基础设施支出将达到 4500 亿美元,其中推理算力占比首次超过 70%。她同时判断,全球存储产值将在 2026 年首次超越晶圆代工,成为半导体产业的第一增长极。
在此背景下,存储正在从一个 " 配角 ",转变为决定推理性能的关键因素。
石静与我们分享了一个更具体的例子:AI 智能体在工作时会频繁调用相同的工具包和数据源,KV Cache 的重复利用率极高。但如果没有合理的卸载机制,所有 KV Cache 都挤在 HBM 里,显存很快被撑爆。" 表现就是吐字延时非常高,响应卡顿,用户体验很差。" 石静指出。企业面对这种情况,通常只有两条路:要么买更贵的、显存更大的高端 GPU,要么就只能眼睁睁看着业务并发上不去。
存储进化方向
解决显存墙,理论上只有两条技术路线。一条是在算法层面压缩 KV Cache 的体积,从源头上减少数据量。另一条是把 KV Cache 从 HBM 里搬出来,放到容量更大、成本更低的存储介质上,比如 CPU 的 DRAM 或者本地 SSD,再或者分布式存储。
这其中,第二条路径已经成为厂商重点布局的路径。开源的 LMCache 可以在 GPU、CPU 和本地磁盘之间灵活存储 KV Cache。实测数据显示,在多轮问答和 RAG 场景中,LMCache 能实现 3~10 倍的延迟降低。谷歌云也在 2025 年推出了基于 Managed Lustre 的外部 KV Cache 方案,据披露数据显示,该方式可将 TCO 降低 35%,用大约 40% 甚至更少的 GPU 支撑同样的工作负载。
这些方案虽然能够一时解决显存墙的问题,但他们都有一个比较明显的瓶颈:大多是 " 单机版 "。对此,石静告诉我们,LMCache 虽然能破除 KV Cache 的实例级隔离,但在 HBM、DRAM、Local SSD 三级仍存在较大程度的节点级资源孤岛。
这就带来了两个问题,一个是资源利用率低。A 节点缓存的 KV Cache,B 节点用不了,只能各自重新计算,这也又导致集群应用下,算力的浪费。另一个是元数据管理混乱。模型推理引擎、框架原生组件、第三方 KV 组件各有各的元数据管理方式,三层嵌套,缺乏全局视角。石静管这叫 " 元数据迷雾 "," 没有全局视角,就没办法判断什么时候该把 KV Cache 放到哪一个层级。" 石静强调。
此外,更为 " 致命 " 的问题在 L4 层(分布式存储层)。理论上,分布式存储天然适合做 KV Cache 的池化共享,因为其容量大、成本低、可跨节点访问。但现实是,分布式存储的强一致性锁机制带来较大的延迟,导致它长期被当作 " 冷数据仓库 " 使用。
也就是说,KV Cache 的分层管理在 L1~L3(HBM、DRAM、本地 SSD)已经有了不错的实践,但到了真正能实现大规模池化共享的 L4 层,反而卡住了。分布式存储的性能不够好,延迟太高,无法直接参与推理的实时数据流动。
正是看到了这个卡点,中科曙光在 2026 中国国际大数据产业博览会(数博会)期间发布了 ParaCache。据石静介绍,ParaCache 的核心思路是将 KV Cache 的管理从单机扩展到集群,从四个层级(L1 HBM、L2 CPU DRAM、L3 SSD、L4 分布式存储)实现全局池化和动态调度。
当然,这个过程并非 " 一蹴而就 ",实现路径中经历了不少的挑战。首先,在 L3 层,ParaCache 做了一件业界此前没人做过的事——把集中式存储 FlashNexus 纳入缓存体系。
传统的 L3 层用的是计算节点自带的本地 SSD,存算一体,难以跨机共享,而且 SSD 盘性能受限于 CPU 和 PCIe 通道。FlashNexus Neo 是专门为 AI 推理设计的硬件系列,通过存算解耦实现全局共享,单阵列提供 160GB/s 带宽能力。实测数据显示,在 TTFT、QPS、吞吐量等关键指标上,使用 FlashNexus Neo 构建的 L3 缓存池比本地 NVMe SSD 有接近 2 倍的提升。
据石静介绍,在 L4 层挑战更大。ParaStor F9000 本身已经是高性能的分布式全闪存储底座(单框提供 220GB/s 带宽和 1000 万 IOPS)。但光有高性能硬件还不够,ParaCache 针对 KV Cache 的应用方式做了几项定向优化。
第一是数据写入方式。传统分布式存储使用 offset 覆盖写,ParaCache 改成追加写,更有利于降低延迟;第二是锁机制。分布式存储被人诟病最多的就是强一致性带来的延迟,ParaCache 在 KV Cache 场景下做了轻量化处理,可以基于目录去掉分布式锁,或者去除重量的排他锁;第三是在 PD 分离架构下,只让节点间传输增量 KV,节省集群网络带宽。
在全局调度层面,ParaCache 提出了一个 "Best-effort 数据预取 " 的机制。推理框架调用 KV 时,会先判断 KV 是否存在,再调用数据获取,判断与获取之间存在一个时间差。对于已经卸载到 L3 或 L4 的冷 KV,ParaCache 利用这个时间差提前预取。" 不用等通知了再去调,而是通过算法提前感知到需要的时候,先把 KV 调到所需要的层级上,把等待时间化为加速。" 石静介绍道。
从测试数据来看,效果是明显的。在多轮对话场景下(30k 初始输入叠加 20 轮对话),ParaCache 让首次延迟降低了 89%。在多并发场景下,相较于仅使用 HBM 的方案,吞吐量提升了近 26 倍。在与头部互联网厂商的在线推理业务合作中,TTFT 降低了 77%,P99 TTFT 优化了 84%,吞吐量提升了 3 倍,缓存命中率提升了 5.7 倍。
这些数字背后有一个共同的逻辑:企业不需要通过堆叠更多的高性能的 GPU,而是通过软件层面的优化,减少 GPU 花在重复计算和数据搬运上的时间,从而让 GPU 把更多时间花在真正的计算上。
存储的角色正在被重写
ParaCache 的发布,折射出存储行业正在经历变革。赛迪顾问发布的《中国分布式存储市场研究报告(2026)》显示,2025 年中国分布式存储市场规模达到 289.4 亿元,同比增长 46%,四年累计增幅 177.8%。
但这个市场正在发生结构性的变化。存储不再只是一个存放数据的容器。对此,石静对我们表示,KV Cache 正在从 " 临时状态 " 变成数据资产。传统的架构里,GPU 是中心,KV Cache 只是它计算过程中的一个中间产物。但在新的架构下,KV Cache 本身是有价值的、可复用的数据,GPU 应该围绕这些数据去提供 Prefill 和 Decode 的计算能力。
而这个判断将会给存储带来很大的影响。最直接的影响是 AI 集群的建设思路。以前规划一个智算中心,核心指标是有多少张 GPU 卡。现在变成了算力、存储、网络乃至缓存的一体化规划。石静表示,现在企业在选择方案时,会更多从 TCO 成本去考虑," 不再单纯堆砌 GPU,而是把 SSD 和分布式存储都纳入 KV Cache 管理的考量范围。" 石静如是说。
此外,石静也表示这一轮变化也给国产存储的厂商带来了更多的机会。以前存储技术跟随国外,但这两年国内大规模智算中心建设带来了大量实际场景和真实需求。" 从计算、存储到网络,国产化的技术和方案层出不穷。" 石静说。
当然,ParaCache 并非适用所有场景。石静坦言,短请求、问一次就不再问的场景,KV Cache 复用率低,收益不明显。此外,实时交易性非常强的场景,对延迟要求极高,L2 到 L4 无论如何优化也追不上 L1 HBM 的速度。但她也指出,这两个极端场景在当前的推理应用中不是最多的。" 真正需求大的是多轮对话、知识库问答、RAG、AI 智能体工作流,这些场景里,公共 KV Cache 的占比越来越高,ParaCache 的价值也越来越大。" 石静指出。
存储正在从一个 " 配角 " 走向前台。它不是要替代 GPU,而是要让 GPU 的算力花在真正该花的地方,而不是等数据、搬数据。如果一套存储方案能让已有的 GPU 跑出两三倍的吞吐量,让首包延迟降下来,让并发请求扛得住,那它就不只是一个存储产品,而是推理效率的放大器。(本文首发于钛媒体 APP,文|Leo 张 ToB 杂谈,作者|张申宇,编辑丨盖虹达)