Files
tech/知识/Mooncake_项目/2026-08-06_Welcome_to_Mooncake.md
T
arno c0ba3fb853 文档(金鹏): 2026-08-06 章节 48 篇文章摘要归档
- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇)
- 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/
- 章节重组为 9 个主题分组并挂接摘要引用
2026-08-06 18:00:50 +08:00

91 lines
6.7 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Welcome to Mooncake
> **来源**Mooncake 项目
> **作者**:未知
> **发布日期**2026-08-06
> **原文链接**https://kvcache-ai.github.io/Mooncake/index.html
---
![Mooncake](https://kvcache-ai.github.io/_images/mooncake-icon.png)
**A KVCache-centric Disaggregated Architecture for LLM Serving.**
Mooncake 是 Kimi(月之暗面提供的领先 LLM 服务)的服务平台。现在 Transfer Engine 和 Mooncake Store 均已开源!本仓库还托管其技术报告和开源 traces。
## 更新日志
- **May 7, 2026**vLLM 正式支持 Mooncake Store——深入介绍 Mooncake 的分布式 KVCache 引擎如何通过高吞吐、内存高效、跨实例的 KV cache 共享为 vLLM 推理提速。
- **Apr 29, 2026**SGLang 引入基于 RDMA 的 P2P 权重传输,使用 Mooncake TransferEngine 支持大规模分布式 RL1T 参数 Kimi-K2 模型的权重更新速度提升 7 倍(53s → 7.2s),在数千 GPU 上实现零拷贝 RDMA 传输。
- **Mar 19, 2026**TorchSpecSpeculative Decoding Training at Scale 开源,使用 Mooncake 通过高效的 hidden states 管理解耦推理与训练。
- **Feb 12, 2026**Mooncake 正式加入 PyTorch Ecosystem
- **Jan 28, 2026**FlexKV(腾讯与 NVIDIA 及社区合作开发的分布式 KV 存储与缓存系统)现支持与 Mooncake Transfer Engine 的分布式 KVCache 复用。
- **Dec 23, 2025**SGLang 引入 Encode-Prefill-Decode (EPD) 解耦,以 Mooncake 作为传输后端。该集成允许将计算密集型多模态编码器(如 Vision Transformers)从语言模型节点解耦,利用 Mooncake 的 RDMA 引擎零拷贝传输大型多模态 embeddings。
- **Dec 19, 2025**Mooncake Transfer Engine 已集成到 TensorRT LLM,用于 PD 解耦推理中的 KVCache 传输。
- **Dec 19, 2025**Mooncake Transfer Engine 已作为 KV Connector 直接集成到 vLLM v1 的 PD 解耦部署中。
- **Nov 07, 2025**RBG + SGLang HiCache + Mooncake——基于角色的开箱即用云原生部署方案,弹性、可扩展、高性能。
- **Sept 18, 2025**Mooncake Store 作为分布式 KV cache 池后端赋能 vLLM Ascend。
- **Sept 10, 2025**SGLang 正式支持 Mooncake Store 作为分层 KV 缓存存储后端。该集成将 RadixAttention 扩展到跨设备、主机和远程存储层的多级 KV cache 存储。
- **Sept 10, 2025**Mooncake P2P Store 的官方高性能版本以 checkpoint-engine 开源。已成功应用于 K1.5 和 K2 生产训练,约 20 秒内完成跨数千 GPU 的 Kimi-K2(1T 参数)模型更新。
- **Aug 23, 2025**xLLM 高性能推理引擎基于 Mooncake 构建混合 KV 缓存管理,支持全局 KV 缓存管理与智能卸载、预取。
- **Aug 18, 2025**vLLM-Ascend 集成 Mooncake Transfer Engine 实现 KV cache 注册与解耦预填充,在昇腾 NPU 上支持高效分布式推理。
- **Jul 20, 2025**Mooncake 在 128 块 H200 GPU 上支撑 Kimi K2 部署,采用 PD 解耦和大规模专家并行,实现 224k tokens/sec 预填充吞吐和 288k tokens/sec 解码吞吐。
- **Jun 20, 2025**Mooncake 成为 LMDeploy 的 PD 解耦后端。
- **May 9, 2025**NIXL 正式支持 Mooncake Transfer Engine 作为后端插件。
- **May 8, 2025**Mooncake x LMCache 联合,开创以 KVCache 为中心的 LLM 服务系统。
- **May 5, 2025**:在 Mooncake 团队支持下,SGLang 发布在 96 块 H100 GPU 上使用 PD 解耦部署 DeepSeek 的指南。
- **Apr 22, 2025**LMCache 正式支持 Mooncake Store 作为远程连接器。
- **Apr 10, 2025**SGLang 正式支持 Mooncake Transfer Engine 用于解耦预填充和 KV cache 传输。
- **Mar 7, 2025**:开源 Mooncake Store——基于 Transfer Engine 的分布式 KVCache。基于 Mooncake Store 的 vLLM xPyD 解耦预填充与解码即将发布。
- **Feb 25, 2025**Mooncake 荣获 FAST 2025 最佳论文奖(Best Paper Award)!
- **Feb 21, 2025**FAST'25 论文中使用的更新版 traces 已发布。
- **Dec 16, 2024**vLLM 正式支持 Mooncake Transfer Engine 用于解耦预填充和 KV cache 传输。
- **Nov 28, 2024**:开源 Transfer Engine——Mooncake 的核心组件。同时提供两个演示:P2P Store 和 vLLM 集成。
- **July 9, 2024**:以 JSONL 文件形式开源 trace。
- **June 27, 2024**:发布一系列中文博客(知乎,共 7 篇)。
- **June 26, 2024**:初始技术报告发布。
## 文档导航(概要)
**Getting Started**
- Build GuidePyPI Package、Automatic Build、Manual Build、Docker Containers、Advanced Compile Options
- Quick StartInstallation、Transfer Engine Quick Start、Mooncake Store Quick Start
- Supported Communication ProtocolsQuick Reference、Python API、C++ Transfer Engine、Configuration Examples、Troubleshooting
- ObservabilityMaster Metrics Log、Prometheus Metrics Endpoint
- SGLang Disaggregated Serving with MooncakeTransferEngine
- SGLang HiCache with Mooncake Backend
- Mooncake x vLLM Integration
- Mooncake x LMCache Integration
- LMDeploy Disaggregated Serving with MooncakeTransferEngine
- Mooncake HF3FS Plugin (Experimental)
**Performance**
- vLLM Performance Benchmarks
- PD Disaggregation Performance
- Benchmark on NVIDIA A10
- SGLang HiCache with Mooncake Backend Benchmark
- vLLM with Mooncake Transfer Engine Benchmark
- Allocator Performance / AllocationStrategy Performance
- Mooncake SSD Offload Benchmark
- Mooncake KVCache Storage Benchmark
**Design Documents**
- Mooncake ArchitectureArchitectural Overview
- Mooncake StoreIntroduction、Architecture、Client C++ API、Master Service、Buffer Allocator、AllocationStrategy、Eviction Policy、Lease、Soft Pin、Hard Pin、Zombie Object Cleanup、Preferred Segment Allocation、Multi-layer Storage Support、Builtin Metadata Server、Python API、Version Management Policy
- P2P StoreOverview、Sample Program、API
- Transfer EngineOverview、Bench、C/C++ API、Advanced Runtime Options、C++ API Reference、EFA Transport (AWS)、Ascend Transport、Sunrise Link Transport、Supported Protocols、Benchmark and Tuning Guide
- Mooncake x SGLang HiCache System DesignHiRadixTree、Local Match、Prefetch from L3、Data Write-back、Multi-Rank Synchronization、PD-Disaggregation Deployment
- EngramStore Backend
- Unified Parallel Tensor IO
- TENT: Transfer Engine NEXTCore Design、TENT C++ API、Metrics、Transport Selection、QoS、Slice Spraying、Failover
- Mooncake Transfer Engine Benchmark TooltebenchGuide
- Mooncake Conductor Architecture
- Mooncake Conductor Indexer API
**Deployment**
- Mooncake Store Deployment & Operations Guide
- Mooncake NVMe-oF SSD Pool Deployment Guide
**Archived**
- Guide: vLLM MooncakeStoreConnector、vLLM V0 Disaggregated Serving Demo、vLLM V0 Disaggregated Serving with MooncakeStore、vLLM v1 backend Disaggregated Serving with MooncakeConnector