文档(金鹏): 2026-08-06 章节 48 篇文章摘要归档
- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇) - 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/ - 章节重组为 9 个主题分组并挂接摘要引用
This commit is contained in:
@@ -0,0 +1,82 @@
|
||||
# 📊 文章摘要:PD 分离推理架构详解
|
||||
|
||||
> **原文**:[2025-09-21_PD_分离推理架构详解.md](./2025-09-21_PD_分离推理架构详解.md)
|
||||
> **原文链接**:https://cloud.tencent.com/developer/article/2586469
|
||||
> **来源**:腾讯云开发者社区
|
||||
> **作者**:cr7258
|
||||
> **发布日期**:2025-09-21
|
||||
> **摘要日期**:2026-08-06
|
||||
> **价值评级**:⭐⭐⭐ 高
|
||||
|
||||
---
|
||||
|
||||
## 核心命题
|
||||
|
||||
> **阶段解耦** — 以 Goodput 为准绳,把 prefill 与 decode 物理分离并按阶段特性分别优化,是同时满足 TTFT/TPOT 双 SLO 的更优架构。
|
||||
|
||||
---
|
||||
|
||||
## 文章概要
|
||||
|
||||
本文是 LLM 推理系列第 6 篇,系统讲解 PD 分离架构。真正想说的是:continuous batching 下 prefill(计算密集)与 decode(内存密集)共置会相互干扰——prompt 长度 1024 时 decode 延迟被放大 12.6 倍——难以同时满足 TTFT 与 TPOT 双 SLO,而将两阶段分配到不同 GPU 实例并按各自特性优化,可在满足 SLO 前提下把有效吞吐(Goodput)提升约 2 倍。重要在于它串联了从 Goodput 指标、干扰量化、KV Cache 传输(开销/方式/粒度)到 vLLM KV Connector 五种实现,再到 Mooncake、Dynamo、llm-d、AIBrix 的工业落地,并对比了 chunked-prefills 的适用边界。局限:数据多引自论文与官方材料,缺乏作者自身实测。
|
||||
|
||||
---
|
||||
|
||||
## 关键要点
|
||||
|
||||
1. **Goodput 优于 Throughput** — 只有满足 TTFT/TPOT SLO 的请求才算有效产出,高吞吐但低 Goodput 的系统用户体验依然糟糕 `[分类: 共识]`
|
||||
2. **共置干扰有量化证据** — prompt 长 128 时 decode 延迟增约 1.8 倍,长 1024 时达 12.6 倍;同时满足双 SLO 时需资源过度配置 `[分类: 共识]`
|
||||
3. **分离即收益** — 2P1D 配置(2 prefill + 1 decode worker)Goodput 约 3.3 rps/GPU,相比共置 1.6 rps/GPU 提升约 2 倍,且未引入任何并行优化 `[分类: 共识]`
|
||||
4. **阶段特性决定优化方向** — prefill 计算受限宜小 batch、张量并行;decode 内存受限宜大 batch、数据/流水线并行;算力与存储可独立优化 `[分类: 共识]`
|
||||
5. **KV 传输开销可被隐藏** — 8 通道 PCIe 5.0 下 OPT-175B 传输估算 17.6ms,低于单次 decode 步骤(30-50ms);按请求级/层级(Splitwise)/块级(TetriInfer)粒度传输 `[分类: 共识]`
|
||||
6. **vLLM 的 KV Connector 抽象层** — SharedStorage/P2pNccl/Nixl/LMCache/Multi 五种 connector,scheduler 通过 KVConnectorMetadata 指挥 worker 传递 KV `[分类: 共识]`
|
||||
7. **工业界已规模验证** — Mooncake 模拟场景吞吐最高提升 525%、Kimi 真实负载多处理 75% 请求;Dynamo 提供 router/queue 四组件与 K8s Operator `[分类: 共识]`
|
||||
8. **PD 分离的适用边界** — 当应用必须同时遵守 TTFT 与 TPOT(而非二者可权衡)时,PD 分离优于 chunked-prefills,后者动态分割无法完全解耦 `[分类: 共识]`
|
||||
|
||||
---
|
||||
|
||||
## 批判性分析
|
||||
|
||||
### 假设前提
|
||||
|
||||
立论假设集群具备高速互联(NVLink/PCIe 5.0/RDMA)且规模足够大,使 KV 传输与调度的额外成本可被摊薄;假设 SLO 是刚性约束(Goodput 定义依赖 P90 分位);假设流量特征稳定到值得为两阶段分别配置资源。
|
||||
|
||||
### 论据与逻辑
|
||||
|
||||
论据多引自 DistServe、Splitwise、Mooncake 等论文与官方博客,"指标→干扰机制→分离收益→传输优化"的逻辑链完整;但 2P1D 实验是泊松流量模拟,未覆盖突发流量与 P/D 配比动态调节,传输延迟估算也基于理想化带宽假设。
|
||||
|
||||
### 边界与局限
|
||||
|
||||
小模型与单卡场景分离收益有限;网络带宽不足时传输开销可能抵消收益;资源孤岛、实例动态配比、角色切换等运维问题仅一笔带过;chunked-prefills 对比较简略,未讨论两类架构的混合方案。
|
||||
|
||||
---
|
||||
|
||||
## 可引用金句
|
||||
|
||||
> "当应用程序无法在 TTFT 和 TPOT 之间进行权衡,而是要同时遵守这两者时,PD 分离就成为更好的选择。"
|
||||
|
||||
> "这个实验表明,即便没有引入任何并行优化,仅仅通过简单的分离,Goodput 就提升了约 2 倍。"
|
||||
|
||||
---
|
||||
|
||||
## 总体评价
|
||||
|
||||
**亮点**:
|
||||
- 覆盖"指标—原理—传输—实现—工业落地"全链路,信息密度高
|
||||
- 干扰效应(1.8x/12.6x)与 KV 传输开销(17.6ms)均有量化估算
|
||||
- vLLM KV Connector 与四套工业方案(Mooncake/Dynamo/llm-d/AIBrix)梳理清晰,可作选型参考
|
||||
|
||||
**不足**:
|
||||
- 数据多转引自论文与官方博客,无作者自身实测
|
||||
- 对 PD 分离隐性成本(调度复杂度、扩容粒度、资源孤岛)着墨较少
|
||||
- chunked-prefills 对比简略,未展开混合架构方案
|
||||
|
||||
**适用场景**:LLM 推理系统架构师、Serving 平台工程师做方案选型与技术调研;想建立 Goodput 与 PD 分离全貌认知的研究者。
|
||||
|
||||
**关联建议**:精读 DistServe、Splitwise、TetriInfer、Mooncake 论文原文;跟踪 vLLM V1 KV Connector 演进与 Dynamo 部署实践。
|
||||
|
||||
---
|
||||
|
||||
## 配图
|
||||
|
||||

|
||||
Reference in New Issue
Block a user