欢迎光临北京软件和信息服务业协会官方网站
XSKY 与 GPUStack 达成战略合作,共建共享 KV Cache 推理底座
发布日期:2026-09-09    来源:XSKY星辰天合    分享到:

2026年9月2日,GPUStack AI Infra 生态与技术创新大会在北京举行。会上,XSKY 星辰天合与 GPUStack 正式签署战略合作协议,双方将发挥各自在 AI 数据基础设施和模型部署管理领域的能力优势,围绕共享 KV Cache、推理加速和异构算力适配等方向展开合作,共同构建面向 Token 工厂的 AI 基础设施。

963ffa62-24a6-4742-971f-cf3e05821228.png


内存墙围困 AI 推理

KV Cache 卸载打开提效空间

大模型进入规模化应用后,推理效率越来越受到内存容量和带宽的制约。AI 编码、企业知识库问答、复杂 Agent 工作流等场景通常包含长上下文、多轮交互和高并发请求,如果每次都重复计算相同内容,就会持续消耗 GPU 算力,拉长首 Token 等待时间。

KV Cache 能够保存已经计算过的上下文状态,并在后续请求中复用,从而减少重复计算。但随着模型规模和并发量增长,单台服务器的 GPU 显存和主机内存很快受到限制,缓存数据也难以在不同推理节点之间共享。

因此,如何将 KV Cache 从有限的显存扩展到主机内存和 NVMe SSD,并实现跨节点共享,成为提升推理性能、降低资源成本的重要方向。XSKY 与 GPUStack 的合作,正是围绕这一问题展开。


MeshFusion 构建 KVCache 和数据底座

GPUStack 连接算力与模型

XSKY MeshFusion 是面向 AI 推理的 KV Cache 扩展加速系统。突破 HBM 容量限制,支持百万级 Token 上下文,原生支持 KV Cache 卸载至共享存储池,释放 GPU 显存,缩短首 Token 响应时间,大幅提升推理吞吐效率,并已通过 ODCC 官方认证(☞点击查看评测报告)。

GPUStack 是一款开源的企业级 AI 基础设施平台,能将本地、云端或混合环境中的任意 GPU 资源统一纳管,组织成高性能 Token 工厂。平台提供模型实例配置、推理服务编排和性能基准测试等能力,企业通过统一界面即可管理模型服务并持续优化部署方案。

双方合作将 MeshFusion 的 KV Cache 存储能力与 GPUStack 的算力调度能力全面打通。让共享 KV Cache 直接接入企业级模型部署流程。

55a0d1df-52c2-4c55-8174-afe3f0b26bb9.png


联合方案落地

推理加速效果可验

GPUStack 负责算力集群管理、模型部署与推理服务编排,XSKY MeshFusion 则提供面向 AI 推理的共享 KV Cache 能力。双方完成产品级集成后,企业可以通过 GPUStack 统一创建和管理 MeshFusion 缓存服务,并将共享缓存直接应用于模型部署。


推理性能跨越式提升

MeshFusion 通过原生 KV Cache 接口和高性能数据访问能力,减少重复上下文计算;GPUStack 则结合模型部署和推理调度,帮助推理请求更高效地使用已有缓存。

在相关测试中,TPS 从 2.3K 提升至 132K,提升约 57 倍;TTFT 从 54 秒优化至 0.97 秒,降低约 98%;读带宽达到 276 GiB/s,相当于集群理论带宽的 90.6%。随着缓存命中率提升,QPM 最高提升 6 倍。在AI编程场景中,代码补全响应从秒级进入毫秒级;企业知识库问答的首轮回复等待时间大幅缩短;Agent工作流的复杂推理链路也不再因缓存不足而频繁超时。


低资源消耗兼顾性能与成本

MeshFusion 将 KV Cache 从显存扩展至内存和 SSD,CPU 和内存开销极低,支持与推理引擎融合部署,无需额外服务器。GPUStack 统一调度推理任务,将各节点请求高效路由至共享存储池,并根据缓存命中情况动态调整实例分配。

MeshFusion 还能感知磁盘容量与磨损情况,主动均衡数据分布,延长 SSD 寿命。整套方案在不增加硬件投入的前提下,以更低资源消耗支撑更高推理并发。


广泛兼容主流算力与模型生态

联合方案同时支持 NVIDIA 、华为昇腾及阿里平头哥等多种算力生态,并兼容多种模型和推理框架。企业无需改变现有的算力环境和模型体系,即可将共享 KV Cache 能力接入 AI 推理流程。

GPUStack 统一纳管异构加速卡,通过可插拔推理后端让缓存与不同推理框架自动适配;MeshFusion 在存储层面完成与各算力平台的 KV Cache 对接。双方将算力、模型、缓存和数据连接起来,共同为企业提供一套灵活、易用的 AI 推理基础设施方案。

1d667212-3a55-49c6-a464-71b43da0a9e6.png


协同共生

共建 Token 工厂基础设施

此次合作的本质,是存储层与算力调度层的深度协同。 XSKY MeshFusion 的共享缓存能力与 GPUStack 的模型部署管理能力的结合,让 KV Cache 从底层技术能力真正落地到模型部署和运维流程。随着 AI 应用从单轮问答走向复杂工作流,这套“存储+算力”一体化的架构,为企业 AI 落地提供了兼顾效率与成本的可行路径。

未来,双方将继续推进模型管理、推理编排与 AI 数据基础设施的协同,适配更多模型、推理框架和异构算力环境,为企业规模化部署生成式 AI 提供更高效、更易管理的基础设施支撑。

你知道你的Internet Explorer是过时了吗?

为了得到我们网站最好的体验效果,我们建议您升级到最新版本的Internet Explorer或选择另一个web浏览器.一个列表最流行的web浏览器在下面可以找到.