Files
tech/知识/Mooncake_项目/2026-08-06_Welcome_to_Mooncake.md
T
arno c0ba3fb853 文档(金鹏): 2026-08-06 章节 48 篇文章摘要归档
- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇)
- 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/
- 章节重组为 9 个主题分组并挂接摘要引用
2026-08-06 18:00:50 +08:00

6.7 KiB
Raw Blame History

Welcome to Mooncake

来源Mooncake 项目
作者:未知
发布日期2026-08-06
原文链接https://kvcache-ai.github.io/Mooncake/index.html


Mooncake

A KVCache-centric Disaggregated Architecture for LLM Serving.

Mooncake 是 Kimi(月之暗面提供的领先 LLM 服务)的服务平台。现在 Transfer Engine 和 Mooncake Store 均已开源!本仓库还托管其技术报告和开源 traces。

更新日志

  • May 7, 2026vLLM 正式支持 Mooncake Store——深入介绍 Mooncake 的分布式 KVCache 引擎如何通过高吞吐、内存高效、跨实例的 KV cache 共享为 vLLM 推理提速。
  • Apr 29, 2026SGLang 引入基于 RDMA 的 P2P 权重传输,使用 Mooncake TransferEngine 支持大规模分布式 RL1T 参数 Kimi-K2 模型的权重更新速度提升 7 倍(53s → 7.2s),在数千 GPU 上实现零拷贝 RDMA 传输。
  • Mar 19, 2026TorchSpecSpeculative Decoding Training at Scale 开源,使用 Mooncake 通过高效的 hidden states 管理解耦推理与训练。
  • Feb 12, 2026Mooncake 正式加入 PyTorch Ecosystem
  • Jan 28, 2026FlexKV(腾讯与 NVIDIA 及社区合作开发的分布式 KV 存储与缓存系统)现支持与 Mooncake Transfer Engine 的分布式 KVCache 复用。
  • Dec 23, 2025SGLang 引入 Encode-Prefill-Decode (EPD) 解耦,以 Mooncake 作为传输后端。该集成允许将计算密集型多模态编码器(如 Vision Transformers)从语言模型节点解耦,利用 Mooncake 的 RDMA 引擎零拷贝传输大型多模态 embeddings。
  • Dec 19, 2025Mooncake Transfer Engine 已集成到 TensorRT LLM,用于 PD 解耦推理中的 KVCache 传输。
  • Dec 19, 2025Mooncake Transfer Engine 已作为 KV Connector 直接集成到 vLLM v1 的 PD 解耦部署中。
  • Nov 07, 2025RBG + SGLang HiCache + Mooncake——基于角色的开箱即用云原生部署方案,弹性、可扩展、高性能。
  • Sept 18, 2025Mooncake Store 作为分布式 KV cache 池后端赋能 vLLM Ascend。
  • Sept 10, 2025SGLang 正式支持 Mooncake Store 作为分层 KV 缓存存储后端。该集成将 RadixAttention 扩展到跨设备、主机和远程存储层的多级 KV cache 存储。
  • Sept 10, 2025Mooncake P2P Store 的官方高性能版本以 checkpoint-engine 开源。已成功应用于 K1.5 和 K2 生产训练,约 20 秒内完成跨数千 GPU 的 Kimi-K2(1T 参数)模型更新。
  • Aug 23, 2025:xLLM 高性能推理引擎基于 Mooncake 构建混合 KV 缓存管理,支持全局 KV 缓存管理与智能卸载、预取。
  • Aug 18, 2025vLLM-Ascend 集成 Mooncake Transfer Engine 实现 KV cache 注册与解耦预填充,在昇腾 NPU 上支持高效分布式推理。
  • Jul 20, 2025Mooncake 在 128 块 H200 GPU 上支撑 Kimi K2 部署,采用 PD 解耦和大规模专家并行,实现 224k tokens/sec 预填充吞吐和 288k tokens/sec 解码吞吐。
  • Jun 20, 2025Mooncake 成为 LMDeploy 的 PD 解耦后端。
  • May 9, 2025NIXL 正式支持 Mooncake Transfer Engine 作为后端插件。
  • May 8, 2025Mooncake x LMCache 联合,开创以 KVCache 为中心的 LLM 服务系统。
  • May 5, 2025:在 Mooncake 团队支持下,SGLang 发布在 96 块 H100 GPU 上使用 PD 解耦部署 DeepSeek 的指南。
  • Apr 22, 2025LMCache 正式支持 Mooncake Store 作为远程连接器。
  • Apr 10, 2025SGLang 正式支持 Mooncake Transfer Engine 用于解耦预填充和 KV cache 传输。
  • Mar 7, 2025:开源 Mooncake Store——基于 Transfer Engine 的分布式 KVCache。基于 Mooncake Store 的 vLLM xPyD 解耦预填充与解码即将发布。
  • Feb 25, 2025Mooncake 荣获 FAST 2025 最佳论文奖(Best Paper Award)!
  • Feb 21, 2025FAST'25 论文中使用的更新版 traces 已发布。
  • Dec 16, 2024vLLM 正式支持 Mooncake Transfer Engine 用于解耦预填充和 KV cache 传输。
  • Nov 28, 2024:开源 Transfer Engine——Mooncake 的核心组件。同时提供两个演示:P2P Store 和 vLLM 集成。
  • July 9, 2024:以 JSONL 文件形式开源 trace。
  • June 27, 2024:发布一系列中文博客(知乎,共 7 篇)。
  • June 26, 2024:初始技术报告发布。

文档导航(概要)

Getting Started

  • Build GuidePyPI Package、Automatic Build、Manual Build、Docker Containers、Advanced Compile Options
  • Quick StartInstallation、Transfer Engine Quick Start、Mooncake Store Quick Start
  • Supported Communication ProtocolsQuick Reference、Python API、C++ Transfer Engine、Configuration Examples、Troubleshooting
  • ObservabilityMaster Metrics Log、Prometheus Metrics Endpoint
  • SGLang Disaggregated Serving with MooncakeTransferEngine
  • SGLang HiCache with Mooncake Backend
  • Mooncake x vLLM Integration
  • Mooncake x LMCache Integration
  • LMDeploy Disaggregated Serving with MooncakeTransferEngine
  • Mooncake HF3FS Plugin (Experimental)

Performance

  • vLLM Performance Benchmarks
  • PD Disaggregation Performance
  • Benchmark on NVIDIA A10
  • SGLang HiCache with Mooncake Backend Benchmark
  • vLLM with Mooncake Transfer Engine Benchmark
  • Allocator Performance / AllocationStrategy Performance
  • Mooncake SSD Offload Benchmark
  • Mooncake KVCache Storage Benchmark

Design Documents

  • Mooncake ArchitectureArchitectural Overview
  • Mooncake StoreIntroduction、Architecture、Client C++ API、Master Service、Buffer Allocator、AllocationStrategy、Eviction Policy、Lease、Soft Pin、Hard Pin、Zombie Object Cleanup、Preferred Segment Allocation、Multi-layer Storage Support、Builtin Metadata Server、Python API、Version Management Policy
  • P2P StoreOverview、Sample Program、API
  • Transfer EngineOverview、Bench、C/C++ API、Advanced Runtime Options、C++ API Reference、EFA Transport (AWS)、Ascend Transport、Sunrise Link Transport、Supported Protocols、Benchmark and Tuning Guide
  • Mooncake x SGLang HiCache System DesignHiRadixTree、Local Match、Prefetch from L3、Data Write-back、Multi-Rank Synchronization、PD-Disaggregation Deployment
  • EngramStore Backend
  • Unified Parallel Tensor IO
  • TENT: Transfer Engine NEXTCore Design、TENT C++ API、Metrics、Transport Selection、QoS、Slice Spraying、Failover
  • Mooncake Transfer Engine Benchmark TooltebenchGuide
  • Mooncake Conductor Architecture
  • Mooncake Conductor Indexer API

Deployment

  • Mooncake Store Deployment & Operations Guide
  • Mooncake NVMe-oF SSD Pool Deployment Guide

Archived

  • Guide: vLLM MooncakeStoreConnector、vLLM V0 Disaggregated Serving Demo、vLLM V0 Disaggregated Serving with MooncakeStore、vLLM v1 backend Disaggregated Serving with MooncakeConnector