kvcache-ai / kvcache-ai/Mooncake

[Feature Request]: 集成绿算技术 GP 系列 NVMe-oF 存储后端,打造极致性能的 Mooncake 大模型推理集群

Open
#2,444 10 comments 0 reactions 1 assignee Claimed by @Luisuantech View on GitHub
stale
Dominant language
C++
Stars
6.6k
Forks
1.2k
Avg merge
3d 5h
Merged PRs (30d)
312

Description

### Describe your feature request

尊敬的 Mooncake 团队:
您好!我们是绿算技术有限公司,国内唯一原生对标 NVIDIA G3/3.5 存储 (CMX) 的解决方案厂商。我们高度关注并赞赏 Mooncake 项目在大模型推理 KV Cache 存储优化领域的开创性工作,注意到项目正在积极推进原生 NVMe-oF 后端 (Storage Backend) 的 RFC 规范与代码集成(如 SsdKvStorageBackend 分支),旨在通过远程存储突破单节点内存墙限制。
我们的 GP 系列通用直连数据栈 (GDDS) 产品(GP-5000/6000/7000/8000)基于全栈自研的 ASIC 加速芯片打造,是专为 AI 大模型推理设计的硬件级高性能 NVMe-oF 存储设备,能够完美适配 Mooncake 的存算分离架构。将 GP 系列设备接入 Mooncake Store,将为大模型推理集群带来三个决定性的改变:
**1. 打通跨机架的 "缓存一致性",实现真正的 "KV Cache 自由路由"**
在纯本地 SSD 方案中,A 节点的缓存冷了落盘到本地,B 节点是读不到的(除非跨网拷贝)。引入 GP-5000 后,它变成了全集群的全局共享存储池。任何 Prefill 节点写进去的 KV Cache,任何 Decode 节点都能以 **≤20 微秒 ** 的端到端延迟直接读取,这一性能指标已在 NVIDIA 官方测试环境中得到验证。
**2. 动态全局负载均衡,彻底消除 "长尾延迟"**
本地 SSD 方案如果遇到某台机器被高频请求(比如某个爆火的 Agent 提示词恰好在它的 SSD 里),该节点的本地 IO 就会过载,导致请求卡顿。GP-5000 提供1620 万 IOPS、GP-6000 提供3240 万 IOPS的超高并发能力,可以轻松把高频热点切片打散到数十块盘上并发读取,彻底消除单点 IO 瓶颈。
**3. 计算节点彻底 "Diskless(无盘化)",大幅降低 TCO**
GPU 服务器不再需要配置昂贵、高功耗且易损坏的大容量本地 NVMe U.2/U.3 硬盘。所有的长文本缓存、模型 Checkpoint 全部卸载到 GP 系列存储阵列中,降低了计算节点的硬件复杂度和故障率,同时减少了散热和电力消耗,整体 TCO 下降 30% 以上。

**我们的核心技术壁垒:自研 ASIC 加速芯片**
上述性能优势的核心支撑是绿算技术自主研发的两款专用存储加速芯片,我们采用 "FPGA 验证先行→ASIC 量产迭代" 的技术路线,目前两款芯片均已完成 FPGA 验证并批量应用于 GP 全系列产品,正在推进 PCIe Gen5 ASIC 芯片的流片工作。
**1. NVMe-oF ASIC 芯片(数据传输核心)**
核心功能:实现网络协议全硬件卸载,让数据从存储设备直接传输到 GPU 显存,完全绕开主机 CPU 和传统软件栈,从物理层面消除 "CPU 瓶颈" 和 "协议开销"。
关键性能:端到端读写延迟≤20 微秒,4 盘 NVMe SSD 聚合读取带宽达 144GB/s,原生支持 RoCEv2/RoCE RDMA 协议和 NVIDIA GPU Direct Storage (GDS) 技术。
技术价值:是实现 "KV Cache 自由路由" 和计算节点 Diskless 架构的核心,让远程存储的访问性能媲美服务器主板直插 SSD。
**2. "ASIC+DPU+FPGA" 多架构并行设计**
区别于 Supermicro 等厂商的单一 DPU 路线,绿算技术采用 "ASIC+DPU+FPGA"三元异构架构,将 ASIC 芯片作为性能底座,结合 FPGA 的灵活性和 DPU 的智能调度能力,实现" 多车道并行 " 的极致效率:
GP-5000:集成专用 ASIC 芯片,内置 100Gb 网卡,实现硬件级协议卸载,是构建大规模存算分离架构的基础单元。
GP-6000:采用 "ASIC+FPGA" 异构架构,性能较 GP-5000 翻倍,支持 GPU 与存储之间的直接数据通路。
GP-7000:采用 "DPU+ASIC+FPGA" 三元架构,将 KV Cache 的索引管理、数据压缩和网络协议栈完全硬件卸载,AI 推理效率提升 20 倍,每 GB/s 带宽功耗仅 3.1W。
**我们的产品生态与兼容性**
原生适配 NVIDIA 生态:全系列产品完全兼容 NVIDIA G3/3.5 存储架构 (CMX),已完成与 BlueField-3/4 DPU、Spectrum-X 交换机的兼容性验证。
全栈自研可控:从底层芯片 IP、RTL 代码到固件、驱动程序全部自主开发,不存在技术卡脖子风险,可根据项目需求快速定制功能。
多形态产品覆盖:提供从机架式、工作站到桌面化的全系产品,满足不同规模推理集群的部署需求。
**合作提议**
我们非常看好 Mooncake 项目在大模型推理优化领域的领先地位,愿意全力支持项目的 NVMe-oF 后端开发工作:
免费提供GP-5000/6000 测试设备供 Mooncake 团队进行性能验证和集成测试
派遣资深芯片与系统工程师全程配合后端对接和调优工作,提供芯片级技术支持
共同开发针对 Mooncake 架构优化的专用存储驱动和 KV Cache 调度策略
分享我们在 NVIDIA CMX 架构和硬件级 KV Cache 存储优化方面的技术积累和工程经验
联系方式
公司官网:[www.luisuantech.com]
邮箱:market@Luisuantech.com
地址:北京海淀区西直门北大街甲 43 号金运大厦 A 座 803 室
我们期待能与 Mooncake 团队深入合作,共同打造业界领先的大模型推理基础设施,推动 AI 技术的普及与发展。
感谢您的考虑!
绿算技术有限公司
2026 年 6 月 12 日

### Before submitting a new issue...

- [x] Make sure you already searched for relevant issues and read the [documentation](https://kvcache-ai.github.io/Mooncake/)

Contributor guide

Open the contributing guide

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.