Files
tech/知识/腾讯云开发者社区/cr7258/2025-09-21_PD_分离推理架构详解_摘要.md
T
arno c0ba3fb853 文档(金鹏): 2026-08-06 章节 48 篇文章摘要归档
- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇)
- 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/
- 章节重组为 9 个主题分组并挂接摘要引用
2026-08-06 18:00:50 +08:00

4.9 KiB
Raw Blame History

📊 文章摘要:PD 分离推理架构详解

原文2025-09-21_PD_分离推理架构详解.md 原文链接https://cloud.tencent.com/developer/article/2586469 来源:腾讯云开发者社区 作者cr7258 发布日期2025-09-21 摘要日期2026-08-06 价值评级


核心命题

阶段解耦 — 以 Goodput 为准绳,把 prefill 与 decode 物理分离并按阶段特性分别优化,是同时满足 TTFT/TPOT 双 SLO 的更优架构。


文章概要

本文是 LLM 推理系列第 6 篇,系统讲解 PD 分离架构。真正想说的是:continuous batching 下 prefill(计算密集)与 decode(内存密集)共置会相互干扰——prompt 长度 1024 时 decode 延迟被放大 12.6 倍——难以同时满足 TTFT 与 TPOT 双 SLO,而将两阶段分配到不同 GPU 实例并按各自特性优化,可在满足 SLO 前提下把有效吞吐(Goodput)提升约 2 倍。重要在于它串联了从 Goodput 指标、干扰量化、KV Cache 传输(开销/方式/粒度)到 vLLM KV Connector 五种实现,再到 Mooncake、Dynamo、llm-d、AIBrix 的工业落地,并对比了 chunked-prefills 的适用边界。局限:数据多引自论文与官方材料,缺乏作者自身实测。


关键要点

  1. Goodput 优于 Throughput — 只有满足 TTFT/TPOT SLO 的请求才算有效产出,高吞吐但低 Goodput 的系统用户体验依然糟糕 [分类: 共识]
  2. 共置干扰有量化证据 — prompt 长 128 时 decode 延迟增约 1.8 倍,长 1024 时达 12.6 倍;同时满足双 SLO 时需资源过度配置 [分类: 共识]
  3. 分离即收益 — 2P1D 配置(2 prefill + 1 decode workerGoodput 约 3.3 rps/GPU,相比共置 1.6 rps/GPU 提升约 2 倍,且未引入任何并行优化 [分类: 共识]
  4. 阶段特性决定优化方向 — prefill 计算受限宜小 batch、张量并行;decode 内存受限宜大 batch、数据/流水线并行;算力与存储可独立优化 [分类: 共识]
  5. KV 传输开销可被隐藏 — 8 通道 PCIe 5.0 下 OPT-175B 传输估算 17.6ms,低于单次 decode 步骤(30-50ms);按请求级/层级(Splitwise/块级(TetriInfer)粒度传输 [分类: 共识]
  6. vLLM 的 KV Connector 抽象层 — SharedStorage/P2pNccl/Nixl/LMCache/Multi 五种 connectorscheduler 通过 KVConnectorMetadata 指挥 worker 传递 KV [分类: 共识]
  7. 工业界已规模验证 — Mooncake 模拟场景吞吐最高提升 525%、Kimi 真实负载多处理 75% 请求;Dynamo 提供 router/queue 四组件与 K8s Operator [分类: 共识]
  8. PD 分离的适用边界 — 当应用必须同时遵守 TTFT 与 TPOT(而非二者可权衡)时,PD 分离优于 chunked-prefills,后者动态分割无法完全解耦 [分类: 共识]

批判性分析

假设前提

立论假设集群具备高速互联(NVLink/PCIe 5.0/RDMA)且规模足够大,使 KV 传输与调度的额外成本可被摊薄;假设 SLO 是刚性约束(Goodput 定义依赖 P90 分位);假设流量特征稳定到值得为两阶段分别配置资源。

论据与逻辑

论据多引自 DistServe、Splitwise、Mooncake 等论文与官方博客,"指标→干扰机制→分离收益→传输优化"的逻辑链完整;但 2P1D 实验是泊松流量模拟,未覆盖突发流量与 P/D 配比动态调节,传输延迟估算也基于理想化带宽假设。

边界与局限

小模型与单卡场景分离收益有限;网络带宽不足时传输开销可能抵消收益;资源孤岛、实例动态配比、角色切换等运维问题仅一笔带过;chunked-prefills 对比较简略,未讨论两类架构的混合方案。


可引用金句

"当应用程序无法在 TTFT 和 TPOT 之间进行权衡,而是要同时遵守这两者时,PD 分离就成为更好的选择。"

"这个实验表明,即便没有引入任何并行优化,仅仅通过简单的分离,Goodput 就提升了约 2 倍。"


总体评价

亮点

  • 覆盖"指标—原理—传输—实现—工业落地"全链路,信息密度高
  • 干扰效应(1.8x/12.6x)与 KV 传输开销(17.6ms)均有量化估算
  • vLLM KV Connector 与四套工业方案(Mooncake/Dynamo/llm-d/AIBrix)梳理清晰,可作选型参考

不足

  • 数据多转引自论文与官方博客,无作者自身实测
  • 对 PD 分离隐性成本(调度复杂度、扩容粒度、资源孤岛)着墨较少
  • chunked-prefills 对比简略,未展开混合架构方案

适用场景LLM 推理系统架构师、Serving 平台工程师做方案选型与技术调研;想建立 Goodput 与 PD 分离全貌认知的研究者。

关联建议:精读 DistServe、Splitwise、TetriInfer、Mooncake 论文原文;跟踪 vLLM V1 KV Connector 演进与 Dynamo 部署实践。


配图

-