当下,大模型正在从实验室走向生产环境,一个显著的变化是算力消耗的重心正从训练侧转向推理侧。当越来越多的企业把大模型接入智能客服、知识库问答、智能体工作流等真实业务,推理请求的规模呈指数级增长,而推理环节本身的效率问题,也随之成为整个AI产业无法回避的瓶颈。
问题集中在两个维度。一方面是推理越来越慢。大模型采用自回归的生成方式,每输出一个新词,都需要重新计算此前所有历史内容的键值向量,计算量随上下文长度呈平方级增长。以16K长度的文本为例,单次推理就需要执行2.56亿次键值对计算,上下文越长,用户等待“第一个字”出现的时间就越久。
另一方面是“记忆”越来越贵。为了避免重复计算,业界普遍采用KV Cache技术,把已经算好的键值向量缓存在GPU显存中,但显存容量有限且价格高昂,随着模型参数增大、上下文窗口拉长,硬件成本急剧攀升。更关键的是,传统KV Cache只能在单对话、单节点内部消除重复计算,一旦进入跨对话、跨节点的大集群场景,加速效果便大打折扣。
正是在这样的背景下,2026中国国际大数据产业博览会期间,中科曙光发布了新一代词元加速方案ParaCache。这不是一款单纯的存储产品,而是一套基于存算协同理念的全层级KV Cache高效管理方案,其核心思路可以概括为一句话:把已经算过的结果长时间保存下来,下次需要时直接复用,让“一次计算、多次使用”成为可能。
一次计算,多次复用
我们看到,ParaCache构建了四级缓存架构,热数据驻留在GPU HBM显存中,温数据下沉到CPU DRAM内存,冷数据则存放于SSD和分布式存储。这一看似简单的分层背后,是对KV Cache全生命周期的系统化管理。
在L3层,中科曙光首次将集中式全闪存储FlashNexus纳入进来,其面向AI推理推出的专用硬件系列FlashNexus Neo,可在多个计算节点之间共享一套集中式存储。相比传统本地SSD方案,FlashNexus在延迟、吞吐量和多请求并发数上均有约2倍的提升。
而在L4层,ParaCache以曙光自研的ParaStor分布式存储为底座,采用业界性能领先的F9000硬件,并针对KV Cache场景做了多项定向优化,将offset覆盖写改为更利于降低延迟的追加写,基于目录机制轻量化甚至移除分布式锁以削减强一致性带来的延迟开销,在PD分离架构中仅传输增量KV以节省集群网络带宽。
更重要的是,L4不再仅仅是一个冷数据仓库。通过XDS技术,这一技术对标NVIDIA的GDS,但同时支持国产AI加速卡ParaCache可以实现GPU显存与分布式存储之间的直接数据卸载与回迁,绕过CPU内存和本地SSD层级,让L4真正参与到KV Cache的实时调度中。中科曙光分布式存储产品部总经理石静在媒体沟通会上坦言,这正是ParaStor能够作为L4层满足生产级推理落地的关键所在。
为了实现全局调度,ParaCache还做了两件基础性的工作。一是全局原数据管理,打破各层级之间的原数据孤岛,只有建立统一视图,才能准确判断某条KV Cache应该放在哪一层、何时该预取、何时该淘汰。二是智能预取,通过与推理框架调度层的配合,在请求真正需要某条KV Cache之前就提前将其加载到更高层级,把等待时间转化为加速时间。在淘汰策略上,ParaCache支持基于目录设置不同的保留周期,有的应用可能几分钟就淘汰,有的则需要保留到小时甚至更长级别,从而适配不同业务的差异化需求。在生态适配方面,ParaCache位于推理框架下层,可无缝对接vLLM、SGLang等主流推理框架,同时也与MoonCake等第三方KV管理厂商开展联合定制开发,企业无需重构现有技术栈即可平滑升级。
多快好省的实测表现
在性能表现上,ParaCache给出了一组颇具说服力的数据。在约12万词元输入长度下,单轮对话的首词元时延最高降低98.5%,降至400毫秒;而在叠加20轮的多轮会话场景中,首词元时延由43.1秒降至4.9秒,降幅超过80%。另一项针对30K和120K输入、同样叠加20轮多轮对话的测试显示,首次延迟降低89%。高并发场景下,词元吞吐量最大提升27倍,这意味着在硬件规模不变的前提下,集群可以承接更多的推理请求。
这些数字背后的逻辑并不复杂。传统方案中,大量并发请求往往共享相似的上下文,同一份知识库、同一套标准提示词、同一批行业文档,相同的基础内容被成千上万次重复计算,GPU算力被大量浪费。ParaCache跨GPU构建分布式共享KV缓存池,同一套上下文只计算一次,释放出的算力用于处理差异化的新增内容,集群整体的并发吞吐量自然水涨船高。
成本方面的收益同样直观。通过冷热数据分层管理,ParaCache大幅降低了推理对高成本显存的依赖。实测显示,即便缓存容量下调,系统性能也几乎不受影响,企业可以用中低配硬件的成本跑出高配硬件的上下文长度。石静在交流中给出了一个参考区间:在内存或SSD的配置上,部署ParaCache后大约可以节省三分之一的硬件采购成本,尽管具体数值因应用场景而异,无法像堆砌算力那样给出一个统一的乘法公式。
从十万卡集群到行业落地
目前,ParaCache已经在包括十万卡规模集群的多个真实场景中完成了验证。ParaCache实现了GPU HBM、CPU DRAM、本地SSD(含FlashNexus集中式存储)、分布式共享存储四个层级的池化与统一调度,支撑起长上下文对话、高并发在线推理、智能体工作流和高通量推理四类核心场景。
面对十万卡规模下的网络压力和数据一致性风险,曙光自研的ScaleFabric全国产RDMA无损网络提供了低时延、零拷贝的网络底座,而ParaCache的原数据持久化设计则确保了故障后数据的正确恢复,避免多会话并发读写可能产生的脏数据问题。
在商业落地层面,国内某头部互联网企业的在线推理业务已经采用了ParaCache,模型首词元平均等待时间降低50%以上,同等硬件条件下可承载的业务请求提升数倍,曙光也成为首家在该头部互联网厂商落地KV Cache管理优化的方案厂商。在金融行业,某银行信用卡中心通过超节点搭配ParaCache,将智能问答场景的并发吞吐量提升了约3倍。在教科研领域,基于RAG知识库的AI助学场景中,系统并发度提升可达15至20倍。
值得注意的是,ParaCache并非对所有场景都同等有效。石静明确指出,短请求、一次性问答这类几乎没有公共KV Cache可复用的场景,收益有限;而对实时性要求极高的交易场景,仍然需要依赖HBM显存本身的性能,毕竟无论L2、L3到L4做得多快,其响应速度都无法与L1显存相比。ParaCache最适合的,是长上下文占比高、存在大量公共重复上下文、并发压力较大的业务,知识库问答、政企智能客服、文档摘要、智能体工作流以及高通量批量推理,都是典型的受益场景。
存算协同的范式之变
从更宏观的视角看,ParaCache的意义不止于一款产品的发布。它折射出AI基础设施建设思路的一次结构性转变。过去,行业遇到性能瓶颈的第一反应是堆GPU,但GPU成本高企且供给受限,单纯堆砌硬件的路径越来越难以为继。与此同时,如果数据路径上存在大量无效计算和额外搬运,GPU本身的算力也无法得到充分发挥。存算协同,正在从一个技术概念变成大规模训推生产环境下的必然选择。
石静对此有一个精炼的概括:“从存数据到存智能。”在她看来,传统推理架构中GPU是绝对的中心,KV Cache只是一个用完即弃的临时状态;而在新的架构下,KV Cache已经成为一种可反复调用的数据资产,GPU应当围绕这些数据提供Prefill-Decode计算能力。
存储的定位也随之重写,从被动的IO响应者,变成推理链条上的主动参与者,决定哪些记忆留在显存、哪些下沉到内存和SSD、哪些进入分布式存储,何时预取、何时淘汰。模型越往大发展,能否管好这些KV Cache,就越有可能直接影响推理应用的服务成本、响应速度和智能体的扩展能力。
“ParaCache并非改写GPU的性能上限,而是通过减少重复计算和数据搬运,让既有算力得到更充分的利用。”石静的这句话,或许可以作为理解ParaCache的最佳注脚。在词元经济正在成为数据要素价值释放新路径的当下,少一次重复计算,就意味着少一段等待、少一份算力消耗,也意味着大模型向规模化生产落地又近了一步。
写在最后
当每一个词元的生成都意味着真实的算力成本,让算过的内容不再重算,就不再是一道技术选择题,而是一道经济必答题。ParaCache 给出的答案很朴素:把价值留在存储里,把算力留给新问题。对于正在寻找大模型落地最优解的企业而言,这或许比任何一张性能榜单都更有说服力。

评论
更多评论