欢迎光临北京软件和信息服务业协会官方网站
当 KVCache 成为大模型推理瓶颈:如何精准评估底层存储支撑能力?
发布日期:2026-07-17    来源:趋境科技    分享到:

伴随大模型推理规模的快速增长,在部分长上下文和高并发推理场景中,KVCache 外存化正在成为重要技术方向。如何让庞大的状态数据在内存、本地 SSD 乃至分布式存储之间高效流转,已成为影响推理成本与响应速度的重要因素之一。然而,传统存储评测方法在 AI 推理场景下面临着新的适配挑战。


面对亟待重构的存储评测体系,在近日举办的 CCF 存储测试场景、技术与社区建设研讨会上,趋境科技技术专家、Mooncake Transfer Engine 作者任峰博士,围绕大模型推理场景下 KVCache 外存化趋势、新型存储系统评测方法,以及 Mooncake 开源社区的相关实践成果进行了深度分享。


KVCache 外存化带来的存储新挑战

在大模型推理系统中,KVCache 正从 GPU 显存中的临时中间结果,演变为决定推理性能、服务成本和用户体验的核心状态数据。随着长上下文、多轮对话以及 Agent 应用的快速演进,KVCache 不仅需要被高效生成与复用,更需要在 GPU 显存、主机内存、本地 SSD 乃至分布式存储之间实现智能化的管理与流转。趋境科技长期深耕这一技术演进所带来的系统级挑战,并持续开展前沿探索。

827b6460-3c52-4e85-852b-4f6b7d6c8fb4.png

传统存储测试工具虽能有效评估设备带宽、访问时延等通用指标,但难以精准刻画大模型推理中的 KVCache 访问特征。在线推理场景下,KVCache 负载不仅受请求时序和前缀复用关系影响,还具备突发访问密集、热点高度集中、读写比例动态变化,以及对尾延迟高度敏感等新特性。


因此,仅依赖通用负载测试,往往难以真实反映业务底层的 I/O 压力。


Mooncake 推出专属 KVCache 存储评测基准

面对上述行业痛点,趋境科技依托 Mooncake 开源社区,推出了专为 KVCache 场景设计的 Storage Benchmark 评测工具。

e6950813-6696-4414-ad49-d09294080d09.png


基于真实 Trace 轻量化重放

该基准尝试基于真实的推理业务 Trace 构建存储评测方法。在无需依赖高昂 GPU 集群资源的前提下,即可精准重放贴近实际业务的 KVCache I/O 过程,为存储系统的选型、对比及性能优化提供极具场景相关性的科学依据。


聚焦 AI 推理真实特征

任峰博士在报告中指出,KVCache Storage Benchmark 并非旨在替代传统存储测试,而是对 AI 推理新场景的重要补充。相较于受模型计算等多维度因素影响的端到端推理测试(尽管其能直接反映 TTFT 等指标),该评测基准提供了一种更轻量、更聚焦、更贴近推理状态数据访问特征的评估手段。


对于广大存储软硬件厂商及开发者而言,KVCache Storage Benchmark 提供了一个直面 AI 推理新负载的评测入口:


  • 降低评估成本:帮助产业界以更低成本,直观对比不同存储介质、文件系统和 I/O 架构对 KVCache 负载的支撑能力。


  • 加速产品优化:存储厂商可借此基准,针对性地检验自身产品在大模型推理场景下的带宽、时延、尾延迟及稳定性表现。这有助于挖掘传统通用测试中难以暴露的隐蔽问题,从而为面向 AI Infra 的产品迭代、方案验证和生态适配指明方向。


此次受邀参会,不仅体现了趋境科技在 AI Infra 关键问题识别与工程实践沉淀上的投入,也彰显了趋境科技在相关技术方向上的持续投入和实践积累。


目前,该评测工具已随 Mooncake 项目正式开源,并计划逐步纳入 CCF 存储测试工作组的标准化测试体系。未来,趋境科技将继续依托 Mooncake 等核心项目进行创新,把一线 AI 推理系统中的真实诉求带入更广泛的技术社区。我们期待与学术界、产业界及存储生态伙伴携手,共同推动新型存储评测方法的建设,助力大模型服务向更高性能、更低成本和更可持续的方向演进。

你知道你的Internet Explorer是过时了吗?

为了得到我们网站最好的体验效果,我们建议您升级到最新版本的Internet Explorer或选择另一个web浏览器.一个列表最流行的web浏览器在下面可以找到.