存储卡脖子?大模型推理真正的瓶颈,中科曙光要来解了
中科曙光推ParaCache方案,大模型推理迈入存算协同新阶段
2026年8月28日,中科曙光正式发布ParaCache分布式KV缓存解决方案,标志着大模型推理基础设施正从“堆GPU”向“存算协同”演进。这一转变源于大模型应用场景的结构性变化:长上下文、多轮对话与AI智能体的普及,使得推理过程中对短期记忆(即KV Cache)的依赖激增,传统以GPU为中心的架构遭遇显存瓶颈。

KV Cache是大模型推理中的关键技术组件,其作用类似于“短期记忆草稿本”——模型在处理用户输入时,会将已计算的Key和Value向量缓存下来,供后续Token生成复用,避免重复计算。然而,随着上下文长度突破数万甚至数十万Token,单次推理所需的KV Cache体积迅速膨胀,常常率先耗尽GPU高带宽内存(HBM),即便算力仍有富余。
中科曙光北京公司总裁助理、分布式存储产品部总经理石静指出,行业已形成“以存换算”的共识。传统KV Cache仅限于单节点、单会话内复用,在跨节点、高并发的智能客服或知识库问答场景中,大量公共上下文被反复计算,造成GPU资源浪费。ParaCache通过构建覆盖GPU HBM、CPU DRAM、SSD及分布式存储的四级缓存体系,实现KV Cache在集群范围内的共享与复用。
据中科曙光披露的测试数据,在高并发推理场景下,ParaCache可将Token吞吐量提升最高达27倍;多轮对话中的首Token时延(TTFT)降低超80%。在真实落地案例中,某银行信用卡中心智能客服系统并发吞吐量提升约3倍,而某教科研知识库问答平台并发能力提升15至20倍。石静表示,该方案尤其适用于长上下文占比高、存在大量重复公共上下文且并发压力大的业务场景。
这一技术路径的背后,是AI基础设施建设逻辑的根本性转变。过去数年,业界普遍采用“遇瓶颈即加GPU”的粗放式扩容策略,但GPU成本高昂、供应受限,且数据搬运与无效计算制约了实际效率。石静强调:“存算协同不是短期改良,而是大规模训练与推理生产的必然趋势。”
中科曙光的底气源于其在存储领域的长期积累。其ParaStor分布式存储与FlashNexus集中式存储产品线已广泛应用于大模型训练、自动驾驶及智算中心等场景。今年7月投入运行的全国产“曙光8000”十万卡AI超集群,已对ParaCache完成全规模验证。
更深远的影响在于架构范式的迁移。石静指出,过去GPU是系统中心,KV Cache仅为临时状态;如今,KV Cache正转变为可复用的“数据资产”,GPU则聚焦于Prefill与Decode两类核心计算任务。未来,KV Cache的管理能力或将直接影响推理服务的成本结构、响应速度乃至AI Agent的横向扩展能力。
从产业视角看,大模型竞争的下半场不再仅比拼峰值算力,更考验数据基础设施的智能化水平。AI集群规划正转向算力、存储、网络与缓存的一体化设计,并以总拥有成本(TCO)为最终标尺。存储的角色也从被动容器升级为主动的数据调度与计算卸载引擎。管好“记忆”,正变得与提升“算力”同等重要。
本文由AI辅助生成


