文档(金鹏): 2026-08-06 章节 48 篇文章摘要归档
- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇) - 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/ - 章节重组为 9 个主题分组并挂接摘要引用
This commit is contained in:
@@ -0,0 +1,90 @@
|
||||
# Welcome to Mooncake
|
||||
|
||||
> **来源**:Mooncake 项目
|
||||
> **作者**:未知
|
||||
> **发布日期**:2026-08-06
|
||||
> **原文链接**:https://kvcache-ai.github.io/Mooncake/index.html
|
||||
|
||||
---
|
||||
|
||||

|
||||
|
||||
**A KVCache-centric Disaggregated Architecture for LLM Serving.**
|
||||
|
||||
Mooncake 是 Kimi(月之暗面提供的领先 LLM 服务)的服务平台。现在 Transfer Engine 和 Mooncake Store 均已开源!本仓库还托管其技术报告和开源 traces。
|
||||
|
||||
## 更新日志
|
||||
|
||||
- **May 7, 2026**:vLLM 正式支持 Mooncake Store——深入介绍 Mooncake 的分布式 KVCache 引擎如何通过高吞吐、内存高效、跨实例的 KV cache 共享为 vLLM 推理提速。
|
||||
- **Apr 29, 2026**:SGLang 引入基于 RDMA 的 P2P 权重传输,使用 Mooncake TransferEngine 支持大规模分布式 RL,1T 参数 Kimi-K2 模型的权重更新速度提升 7 倍(53s → 7.2s),在数千 GPU 上实现零拷贝 RDMA 传输。
|
||||
- **Mar 19, 2026**:TorchSpec:Speculative Decoding Training at Scale 开源,使用 Mooncake 通过高效的 hidden states 管理解耦推理与训练。
|
||||
- **Feb 12, 2026**:Mooncake 正式加入 PyTorch Ecosystem!
|
||||
- **Jan 28, 2026**:FlexKV(腾讯与 NVIDIA 及社区合作开发的分布式 KV 存储与缓存系统)现支持与 Mooncake Transfer Engine 的分布式 KVCache 复用。
|
||||
- **Dec 23, 2025**:SGLang 引入 Encode-Prefill-Decode (EPD) 解耦,以 Mooncake 作为传输后端。该集成允许将计算密集型多模态编码器(如 Vision Transformers)从语言模型节点解耦,利用 Mooncake 的 RDMA 引擎零拷贝传输大型多模态 embeddings。
|
||||
- **Dec 19, 2025**:Mooncake Transfer Engine 已集成到 TensorRT LLM,用于 PD 解耦推理中的 KVCache 传输。
|
||||
- **Dec 19, 2025**:Mooncake Transfer Engine 已作为 KV Connector 直接集成到 vLLM v1 的 PD 解耦部署中。
|
||||
- **Nov 07, 2025**:RBG + SGLang HiCache + Mooncake——基于角色的开箱即用云原生部署方案,弹性、可扩展、高性能。
|
||||
- **Sept 18, 2025**:Mooncake Store 作为分布式 KV cache 池后端赋能 vLLM Ascend。
|
||||
- **Sept 10, 2025**:SGLang 正式支持 Mooncake Store 作为分层 KV 缓存存储后端。该集成将 RadixAttention 扩展到跨设备、主机和远程存储层的多级 KV cache 存储。
|
||||
- **Sept 10, 2025**:Mooncake P2P Store 的官方高性能版本以 checkpoint-engine 开源。已成功应用于 K1.5 和 K2 生产训练,约 20 秒内完成跨数千 GPU 的 Kimi-K2(1T 参数)模型更新。
|
||||
- **Aug 23, 2025**:xLLM 高性能推理引擎基于 Mooncake 构建混合 KV 缓存管理,支持全局 KV 缓存管理与智能卸载、预取。
|
||||
- **Aug 18, 2025**:vLLM-Ascend 集成 Mooncake Transfer Engine 实现 KV cache 注册与解耦预填充,在昇腾 NPU 上支持高效分布式推理。
|
||||
- **Jul 20, 2025**:Mooncake 在 128 块 H200 GPU 上支撑 Kimi K2 部署,采用 PD 解耦和大规模专家并行,实现 224k tokens/sec 预填充吞吐和 288k tokens/sec 解码吞吐。
|
||||
- **Jun 20, 2025**:Mooncake 成为 LMDeploy 的 PD 解耦后端。
|
||||
- **May 9, 2025**:NIXL 正式支持 Mooncake Transfer Engine 作为后端插件。
|
||||
- **May 8, 2025**:Mooncake x LMCache 联合,开创以 KVCache 为中心的 LLM 服务系统。
|
||||
- **May 5, 2025**:在 Mooncake 团队支持下,SGLang 发布在 96 块 H100 GPU 上使用 PD 解耦部署 DeepSeek 的指南。
|
||||
- **Apr 22, 2025**:LMCache 正式支持 Mooncake Store 作为远程连接器。
|
||||
- **Apr 10, 2025**:SGLang 正式支持 Mooncake Transfer Engine 用于解耦预填充和 KV cache 传输。
|
||||
- **Mar 7, 2025**:开源 Mooncake Store——基于 Transfer Engine 的分布式 KVCache。基于 Mooncake Store 的 vLLM xPyD 解耦预填充与解码即将发布。
|
||||
- **Feb 25, 2025**:Mooncake 荣获 FAST 2025 最佳论文奖(Best Paper Award)!
|
||||
- **Feb 21, 2025**:FAST'25 论文中使用的更新版 traces 已发布。
|
||||
- **Dec 16, 2024**:vLLM 正式支持 Mooncake Transfer Engine 用于解耦预填充和 KV cache 传输。
|
||||
- **Nov 28, 2024**:开源 Transfer Engine——Mooncake 的核心组件。同时提供两个演示:P2P Store 和 vLLM 集成。
|
||||
- **July 9, 2024**:以 JSONL 文件形式开源 trace。
|
||||
- **June 27, 2024**:发布一系列中文博客(知乎,共 7 篇)。
|
||||
- **June 26, 2024**:初始技术报告发布。
|
||||
|
||||
## 文档导航(概要)
|
||||
|
||||
**Getting Started**
|
||||
- Build Guide(PyPI Package、Automatic Build、Manual Build、Docker Containers、Advanced Compile Options)
|
||||
- Quick Start(Installation、Transfer Engine Quick Start、Mooncake Store Quick Start)
|
||||
- Supported Communication Protocols(Quick Reference、Python API、C++ Transfer Engine、Configuration Examples、Troubleshooting)
|
||||
- Observability(Master Metrics Log、Prometheus Metrics Endpoint)
|
||||
- SGLang Disaggregated Serving with MooncakeTransferEngine
|
||||
- SGLang HiCache with Mooncake Backend
|
||||
- Mooncake x vLLM Integration
|
||||
- Mooncake x LMCache Integration
|
||||
- LMDeploy Disaggregated Serving with MooncakeTransferEngine
|
||||
- Mooncake HF3FS Plugin (Experimental)
|
||||
|
||||
**Performance**
|
||||
- vLLM Performance Benchmarks
|
||||
- PD Disaggregation Performance
|
||||
- Benchmark on NVIDIA A10
|
||||
- SGLang HiCache with Mooncake Backend Benchmark
|
||||
- vLLM with Mooncake Transfer Engine Benchmark
|
||||
- Allocator Performance / AllocationStrategy Performance
|
||||
- Mooncake SSD Offload Benchmark
|
||||
- Mooncake KVCache Storage Benchmark
|
||||
|
||||
**Design Documents**
|
||||
- Mooncake Architecture(Architectural Overview)
|
||||
- Mooncake Store(Introduction、Architecture、Client C++ API、Master Service、Buffer Allocator、AllocationStrategy、Eviction Policy、Lease、Soft Pin、Hard Pin、Zombie Object Cleanup、Preferred Segment Allocation、Multi-layer Storage Support、Builtin Metadata Server、Python API、Version Management Policy)
|
||||
- P2P Store(Overview、Sample Program、API)
|
||||
- Transfer Engine(Overview、Bench、C/C++ API、Advanced Runtime Options、C++ API Reference、EFA Transport (AWS)、Ascend Transport、Sunrise Link Transport、Supported Protocols、Benchmark and Tuning Guide)
|
||||
- Mooncake x SGLang HiCache System Design(HiRadixTree、Local Match、Prefetch from L3、Data Write-back、Multi-Rank Synchronization、PD-Disaggregation Deployment)
|
||||
- EngramStore Backend
|
||||
- Unified Parallel Tensor IO
|
||||
- TENT: Transfer Engine NEXT(Core Design、TENT C++ API、Metrics、Transport Selection、QoS、Slice Spraying、Failover)
|
||||
- Mooncake Transfer Engine Benchmark Tool(tebench)Guide
|
||||
- Mooncake Conductor Architecture
|
||||
- Mooncake Conductor Indexer API
|
||||
|
||||
**Deployment**
|
||||
- Mooncake Store Deployment & Operations Guide
|
||||
- Mooncake NVMe-oF SSD Pool Deployment Guide
|
||||
|
||||
**Archived**
|
||||
- Guide: vLLM MooncakeStoreConnector、vLLM V0 Disaggregated Serving Demo、vLLM V0 Disaggregated Serving with MooncakeStore、vLLM v1 backend Disaggregated Serving with MooncakeConnector
|
||||
@@ -0,0 +1,82 @@
|
||||
# 📊 文章摘要:Welcome to Mooncake(KVCache 中心的分离式 LLM 服务架构)
|
||||
|
||||
> **原文**:[2026-08-06_Welcome_to_Mooncake.md](./2026-08-06_Welcome_to_Mooncake.md)
|
||||
> **原文链接**:https://kvcache-ai.github.io/Mooncake/index.html
|
||||
> **来源**:Mooncake 项目官网
|
||||
> **作者**:未知(月之暗面 Moonshot AI / Kimi 团队)
|
||||
> **发布日期**:2026-08-06
|
||||
> **摘要日期**:2026-08-06
|
||||
> **价值评级**:⭐⭐ 中
|
||||
|
||||
---
|
||||
|
||||
## 核心命题
|
||||
|
||||
> **KVCache 中心化** — 以 KVCache 为核心的 PD 分离服务架构,已从论文演进为被 vLLM、SGLang 等主流推理引擎广泛集成的开源基础设施生态。
|
||||
|
||||
---
|
||||
|
||||
## 文章概要
|
||||
|
||||
本文是 Mooncake 项目的官网首页,主体内容为 2024 年 6 月至 2026 年 5 月的完整更新日志(约 30 条)与文档导航。其认知价值在于:以时间线形式记录了"KVCache 中心分离式架构"从 FAST'25 最佳论文走向工程落地、并被 vLLM/SGLang/TensorRT-LLM/LMDeploy/LMCache 等十余个主流组件集成的全过程,是观察 LLM 推理基础设施生态演进的一手材料。文中提供若干关键性能数字(Kimi-K2 权重更新 53s→7.2s、128 块 H200 上 224k/288k tokens/sec 吞吐等)。局限在于:内容为项目自述的公告集合,无实验细节、无失败教训、无边界条件讨论,性能数据需谨慎对待。
|
||||
|
||||
---
|
||||
|
||||
## 关键要点
|
||||
|
||||
1. **开源组件全景** — 核心组件 Transfer Engine(RDMA 高速传输)与 Mooncake Store(分布式 KVCache 池)均已开源,配套 P2P Store、checkpoint-engine、TENT(Transfer Engine NEXT)等。 `[分类: 共识]`
|
||||
|
||||
2. **生态集成是主要影响力路径** — vLLM(KV Connector)、SGLang(HiCache/EPD 解耦)、TensorRT-LLM、LMDeploy、LMCache、xLLM、FlexKV(腾讯)等相继接入 Mooncake,说明"以 KVCache 为中心 + 分离式"已成为行业共同技术方向。 `[分类: 共识]`
|
||||
|
||||
3. **分离式架构的量化收益** — 1T 参数 Kimi-K2 权重更新跨数千 GPU 约 20 秒完成(经 checkpoint-engine,2025 年 9 月),后经 SGLang RDMA P2P 权重传输进一步降至 7.2 秒;128 块 H200 上实现 224k tokens/sec 预填充、288k tokens/sec 解码吞吐。 `[分类: 共识]`
|
||||
|
||||
4. **FAST'25 最佳论文的学术背书** — 2025 年 2 月获存储领域顶会 FAST 2025 最佳论文奖,论文配套 traces 已开源,为后续研究提供可复现数据。 `[分类: 共识]`
|
||||
|
||||
5. **文档的局限沉默** — 全文无任何关于架构取舍、失败经验、CPU/DRAM/SSD 异构资源调度复杂度的讨论,也未说明中小规模部署场景的适用性,是典型的项目宣传口径。 `[分类: 未探索]`
|
||||
|
||||
---
|
||||
|
||||
## 批判性分析
|
||||
|
||||
### 假设前提
|
||||
|
||||
- 假设大规模集群中 GPU 间存在高速 RDMA 网络(Transfer Engine 依赖),且集群拥有可观的空闲 CPU/DRAM/SSD 资源可供 KVCache 缓存利用;这两条假设决定了 Mooncake 方案主要面向万卡级别的超大规模生产集群。
|
||||
- 假设 PD 分离与 KVCache 复用带来的收益大于调度与传输的复杂度成本。
|
||||
|
||||
### 论据与逻辑
|
||||
|
||||
- 更新日志中的性能数字(7.2s 权重更新、224k/288k tokens/sec、FAST'25 最佳论文)均为可验证的具体事实,但全部来自项目自述,无独立第三方基准,且"525% 吞吐提升"等来自论文模拟场景而非生产数据。更新日志整体是"成就清单"逻辑,缺少对照与失败记录,论据方向单一。
|
||||
|
||||
### 边界与局限
|
||||
|
||||
- 适用场景:大规模(数百至数千 GPU 以上)LLM 服务集群的 PD 分离、KV cache 池化与权重同步;对中小规模集群,RDMA 基础设施投入与调度复杂度可能不划算。
|
||||
- 文档本身是入口性材料,未提供任何架构细节(架构细节在导航指向的 Design Documents 中),不能仅凭本文评估 Mooncake 的技术优劣。
|
||||
|
||||
---
|
||||
|
||||
## 可引用金句
|
||||
|
||||
> "A KVCache-centric Disaggregated Architecture for LLM Serving."
|
||||
|
||||
---
|
||||
|
||||
## 总体评价
|
||||
|
||||
**亮点**:
|
||||
- 一条时间线浓缩了 2024-2026 年 LLM 推理基础设施生态的演进脉络,信息密度高
|
||||
- 关键性能数字可作为行业动态引用素材;开源 traces 与论文获奖是客观事实
|
||||
- 文档导航完整,是深入 Mooncake 架构的可靠入口
|
||||
|
||||
**不足**:
|
||||
- 纯公告集合,无技术细节、无架构论证、无失败记录与边界讨论
|
||||
- 性能数据均为自述口径,缺少第三方验证,引用需标注来源性质
|
||||
|
||||
**适用场景**:关注 LLM 推理基础设施技术动向的架构师与研究者;需要快速了解 Mooncake 生态集成现状、并决定是否深入阅读其设计文档的人群。
|
||||
|
||||
**关联建议**:结合 Mooncake FAST'25 论文原文、cr7258《Lesson 06:PD 分离推理架构详解》中的 Mooncake 章节、以及 vLLM 官方 KV Connector 文档交叉阅读,可形成对分离式架构的完整认知。
|
||||
|
||||
---
|
||||
|
||||
## 配图
|
||||
|
||||

|
||||
Reference in New Issue
Block a user