文档(金鹏): 2026-08-06 章节 48 篇文章摘要归档

- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇)
- 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/
- 章节重组为 9 个主题分组并挂接摘要引用
This commit is contained in:
2026-08-06 18:00:50 +08:00
parent aa585542d1
commit c0ba3fb853
111 changed files with 13271 additions and 0 deletions
@@ -0,0 +1,82 @@
# 📊 文章摘要:PD 分离推理架构详解
> **原文**[2025-09-21_PD_分离推理架构详解.md](./2025-09-21_PD_分离推理架构详解.md)
> **原文链接**https://cloud.tencent.com/developer/article/2586469
> **来源**:腾讯云开发者社区
> **作者**cr7258
> **发布日期**2025-09-21
> **摘要日期**2026-08-06
> **价值评级**:⭐⭐⭐ 高
---
## 核心命题
> **阶段解耦** — 以 Goodput 为准绳,把 prefill 与 decode 物理分离并按阶段特性分别优化,是同时满足 TTFT/TPOT 双 SLO 的更优架构。
---
## 文章概要
本文是 LLM 推理系列第 6 篇,系统讲解 PD 分离架构。真正想说的是:continuous batching 下 prefill(计算密集)与 decode(内存密集)共置会相互干扰——prompt 长度 1024 时 decode 延迟被放大 12.6 倍——难以同时满足 TTFT 与 TPOT 双 SLO,而将两阶段分配到不同 GPU 实例并按各自特性优化,可在满足 SLO 前提下把有效吞吐(Goodput)提升约 2 倍。重要在于它串联了从 Goodput 指标、干扰量化、KV Cache 传输(开销/方式/粒度)到 vLLM KV Connector 五种实现,再到 Mooncake、Dynamo、llm-d、AIBrix 的工业落地,并对比了 chunked-prefills 的适用边界。局限:数据多引自论文与官方材料,缺乏作者自身实测。
---
## 关键要点
1. **Goodput 优于 Throughput** — 只有满足 TTFT/TPOT SLO 的请求才算有效产出,高吞吐但低 Goodput 的系统用户体验依然糟糕 `[分类: 共识]`
2. **共置干扰有量化证据** — prompt 长 128 时 decode 延迟增约 1.8 倍,长 1024 时达 12.6 倍;同时满足双 SLO 时需资源过度配置 `[分类: 共识]`
3. **分离即收益** — 2P1D 配置(2 prefill + 1 decode workerGoodput 约 3.3 rps/GPU,相比共置 1.6 rps/GPU 提升约 2 倍,且未引入任何并行优化 `[分类: 共识]`
4. **阶段特性决定优化方向** — prefill 计算受限宜小 batch、张量并行;decode 内存受限宜大 batch、数据/流水线并行;算力与存储可独立优化 `[分类: 共识]`
5. **KV 传输开销可被隐藏** — 8 通道 PCIe 5.0 下 OPT-175B 传输估算 17.6ms,低于单次 decode 步骤(30-50ms);按请求级/层级(Splitwise/块级(TetriInfer)粒度传输 `[分类: 共识]`
6. **vLLM 的 KV Connector 抽象层** — SharedStorage/P2pNccl/Nixl/LMCache/Multi 五种 connectorscheduler 通过 KVConnectorMetadata 指挥 worker 传递 KV `[分类: 共识]`
7. **工业界已规模验证** — Mooncake 模拟场景吞吐最高提升 525%、Kimi 真实负载多处理 75% 请求;Dynamo 提供 router/queue 四组件与 K8s Operator `[分类: 共识]`
8. **PD 分离的适用边界** — 当应用必须同时遵守 TTFT 与 TPOT(而非二者可权衡)时,PD 分离优于 chunked-prefills,后者动态分割无法完全解耦 `[分类: 共识]`
---
## 批判性分析
### 假设前提
立论假设集群具备高速互联(NVLink/PCIe 5.0/RDMA)且规模足够大,使 KV 传输与调度的额外成本可被摊薄;假设 SLO 是刚性约束(Goodput 定义依赖 P90 分位);假设流量特征稳定到值得为两阶段分别配置资源。
### 论据与逻辑
论据多引自 DistServe、Splitwise、Mooncake 等论文与官方博客,"指标→干扰机制→分离收益→传输优化"的逻辑链完整;但 2P1D 实验是泊松流量模拟,未覆盖突发流量与 P/D 配比动态调节,传输延迟估算也基于理想化带宽假设。
### 边界与局限
小模型与单卡场景分离收益有限;网络带宽不足时传输开销可能抵消收益;资源孤岛、实例动态配比、角色切换等运维问题仅一笔带过;chunked-prefills 对比较简略,未讨论两类架构的混合方案。
---
## 可引用金句
> "当应用程序无法在 TTFT 和 TPOT 之间进行权衡,而是要同时遵守这两者时,PD 分离就成为更好的选择。"
> "这个实验表明,即便没有引入任何并行优化,仅仅通过简单的分离,Goodput 就提升了约 2 倍。"
---
## 总体评价
**亮点**
- 覆盖"指标—原理—传输—实现—工业落地"全链路,信息密度高
- 干扰效应(1.8x/12.6x)与 KV 传输开销(17.6ms)均有量化估算
- vLLM KV Connector 与四套工业方案(Mooncake/Dynamo/llm-d/AIBrix)梳理清晰,可作选型参考
**不足**
- 数据多转引自论文与官方博客,无作者自身实测
- 对 PD 分离隐性成本(调度复杂度、扩容粒度、资源孤岛)着墨较少
- chunked-prefills 对比简略,未展开混合架构方案
**适用场景**LLM 推理系统架构师、Serving 平台工程师做方案选型与技术调研;想建立 Goodput 与 PD 分离全貌认知的研究者。
**关联建议**:精读 DistServe、Splitwise、TetriInfer、Mooncake 论文原文;跟踪 vLLM V1 KV Connector 演进与 Dynamo 部署实践。
---
## 配图
![-](../../金鹏/20260806/20260806-003.png)