Files
tech/知识/腾讯云开发者社区/cr7258/2025-09-21_PD_分离推理架构详解_摘要.md
arno c0ba3fb853 文档(金鹏): 2026-08-06 章节 48 篇文章摘要归档
- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇)
- 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/
- 章节重组为 9 个主题分组并挂接摘要引用
2026-08-06 18:00:50 +08:00

83 lines
4.9 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 📊 文章摘要:PD 分离推理架构详解
> **原文**[2025-09-21_PD_分离推理架构详解.md](./2025-09-21_PD_分离推理架构详解.md)
> **原文链接**https://cloud.tencent.com/developer/article/2586469
> **来源**:腾讯云开发者社区
> **作者**cr7258
> **发布日期**2025-09-21
> **摘要日期**2026-08-06
> **价值评级**:⭐⭐⭐ 高
---
## 核心命题
> **阶段解耦** — 以 Goodput 为准绳,把 prefill 与 decode 物理分离并按阶段特性分别优化,是同时满足 TTFT/TPOT 双 SLO 的更优架构。
---
## 文章概要
本文是 LLM 推理系列第 6 篇,系统讲解 PD 分离架构。真正想说的是:continuous batching 下 prefill(计算密集)与 decode(内存密集)共置会相互干扰——prompt 长度 1024 时 decode 延迟被放大 12.6 倍——难以同时满足 TTFT 与 TPOT 双 SLO,而将两阶段分配到不同 GPU 实例并按各自特性优化,可在满足 SLO 前提下把有效吞吐(Goodput)提升约 2 倍。重要在于它串联了从 Goodput 指标、干扰量化、KV Cache 传输(开销/方式/粒度)到 vLLM KV Connector 五种实现,再到 Mooncake、Dynamo、llm-d、AIBrix 的工业落地,并对比了 chunked-prefills 的适用边界。局限:数据多引自论文与官方材料,缺乏作者自身实测。
---
## 关键要点
1. **Goodput 优于 Throughput** — 只有满足 TTFT/TPOT SLO 的请求才算有效产出,高吞吐但低 Goodput 的系统用户体验依然糟糕 `[分类: 共识]`
2. **共置干扰有量化证据** — prompt 长 128 时 decode 延迟增约 1.8 倍,长 1024 时达 12.6 倍;同时满足双 SLO 时需资源过度配置 `[分类: 共识]`
3. **分离即收益** — 2P1D 配置(2 prefill + 1 decode workerGoodput 约 3.3 rps/GPU,相比共置 1.6 rps/GPU 提升约 2 倍,且未引入任何并行优化 `[分类: 共识]`
4. **阶段特性决定优化方向** — prefill 计算受限宜小 batch、张量并行;decode 内存受限宜大 batch、数据/流水线并行;算力与存储可独立优化 `[分类: 共识]`
5. **KV 传输开销可被隐藏** — 8 通道 PCIe 5.0 下 OPT-175B 传输估算 17.6ms,低于单次 decode 步骤(30-50ms);按请求级/层级(Splitwise/块级(TetriInfer)粒度传输 `[分类: 共识]`
6. **vLLM 的 KV Connector 抽象层** — SharedStorage/P2pNccl/Nixl/LMCache/Multi 五种 connectorscheduler 通过 KVConnectorMetadata 指挥 worker 传递 KV `[分类: 共识]`
7. **工业界已规模验证** — Mooncake 模拟场景吞吐最高提升 525%、Kimi 真实负载多处理 75% 请求;Dynamo 提供 router/queue 四组件与 K8s Operator `[分类: 共识]`
8. **PD 分离的适用边界** — 当应用必须同时遵守 TTFT 与 TPOT(而非二者可权衡)时,PD 分离优于 chunked-prefills,后者动态分割无法完全解耦 `[分类: 共识]`
---
## 批判性分析
### 假设前提
立论假设集群具备高速互联(NVLink/PCIe 5.0/RDMA)且规模足够大,使 KV 传输与调度的额外成本可被摊薄;假设 SLO 是刚性约束(Goodput 定义依赖 P90 分位);假设流量特征稳定到值得为两阶段分别配置资源。
### 论据与逻辑
论据多引自 DistServe、Splitwise、Mooncake 等论文与官方博客,"指标→干扰机制→分离收益→传输优化"的逻辑链完整;但 2P1D 实验是泊松流量模拟,未覆盖突发流量与 P/D 配比动态调节,传输延迟估算也基于理想化带宽假设。
### 边界与局限
小模型与单卡场景分离收益有限;网络带宽不足时传输开销可能抵消收益;资源孤岛、实例动态配比、角色切换等运维问题仅一笔带过;chunked-prefills 对比较简略,未讨论两类架构的混合方案。
---
## 可引用金句
> "当应用程序无法在 TTFT 和 TPOT 之间进行权衡,而是要同时遵守这两者时,PD 分离就成为更好的选择。"
> "这个实验表明,即便没有引入任何并行优化,仅仅通过简单的分离,Goodput 就提升了约 2 倍。"
---
## 总体评价
**亮点**
- 覆盖"指标—原理—传输—实现—工业落地"全链路,信息密度高
- 干扰效应(1.8x/12.6x)与 KV 传输开销(17.6ms)均有量化估算
- vLLM KV Connector 与四套工业方案(Mooncake/Dynamo/llm-d/AIBrix)梳理清晰,可作选型参考
**不足**
- 数据多转引自论文与官方博客,无作者自身实测
- 对 PD 分离隐性成本(调度复杂度、扩容粒度、资源孤岛)着墨较少
- chunked-prefills 对比简略,未展开混合架构方案
**适用场景**LLM 推理系统架构师、Serving 平台工程师做方案选型与技术调研;想建立 Goodput 与 PD 分离全貌认知的研究者。
**关联建议**:精读 DistServe、Splitwise、TetriInfer、Mooncake 论文原文;跟踪 vLLM V1 KV Connector 演进与 Dynamo 部署实践。
---
## 配图
![-](../../金鹏/20260806/20260806-003.png)