- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇) - 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/ - 章节重组为 9 个主题分组并挂接摘要引用
4.9 KiB
📊 文章摘要:PD 分离推理架构详解
原文:2025-09-21_PD_分离推理架构详解.md 原文链接:https://cloud.tencent.com/developer/article/2586469 来源:腾讯云开发者社区 作者:cr7258 发布日期:2025-09-21 摘要日期:2026-08-06 价值评级:⭐⭐⭐ 高
核心命题
阶段解耦 — 以 Goodput 为准绳,把 prefill 与 decode 物理分离并按阶段特性分别优化,是同时满足 TTFT/TPOT 双 SLO 的更优架构。
文章概要
本文是 LLM 推理系列第 6 篇,系统讲解 PD 分离架构。真正想说的是:continuous batching 下 prefill(计算密集)与 decode(内存密集)共置会相互干扰——prompt 长度 1024 时 decode 延迟被放大 12.6 倍——难以同时满足 TTFT 与 TPOT 双 SLO,而将两阶段分配到不同 GPU 实例并按各自特性优化,可在满足 SLO 前提下把有效吞吐(Goodput)提升约 2 倍。重要在于它串联了从 Goodput 指标、干扰量化、KV Cache 传输(开销/方式/粒度)到 vLLM KV Connector 五种实现,再到 Mooncake、Dynamo、llm-d、AIBrix 的工业落地,并对比了 chunked-prefills 的适用边界。局限:数据多引自论文与官方材料,缺乏作者自身实测。
关键要点
- Goodput 优于 Throughput — 只有满足 TTFT/TPOT SLO 的请求才算有效产出,高吞吐但低 Goodput 的系统用户体验依然糟糕
[分类: 共识] - 共置干扰有量化证据 — prompt 长 128 时 decode 延迟增约 1.8 倍,长 1024 时达 12.6 倍;同时满足双 SLO 时需资源过度配置
[分类: 共识] - 分离即收益 — 2P1D 配置(2 prefill + 1 decode worker)Goodput 约 3.3 rps/GPU,相比共置 1.6 rps/GPU 提升约 2 倍,且未引入任何并行优化
[分类: 共识] - 阶段特性决定优化方向 — prefill 计算受限宜小 batch、张量并行;decode 内存受限宜大 batch、数据/流水线并行;算力与存储可独立优化
[分类: 共识] - KV 传输开销可被隐藏 — 8 通道 PCIe 5.0 下 OPT-175B 传输估算 17.6ms,低于单次 decode 步骤(30-50ms);按请求级/层级(Splitwise)/块级(TetriInfer)粒度传输
[分类: 共识] - vLLM 的 KV Connector 抽象层 — SharedStorage/P2pNccl/Nixl/LMCache/Multi 五种 connector,scheduler 通过 KVConnectorMetadata 指挥 worker 传递 KV
[分类: 共识] - 工业界已规模验证 — Mooncake 模拟场景吞吐最高提升 525%、Kimi 真实负载多处理 75% 请求;Dynamo 提供 router/queue 四组件与 K8s Operator
[分类: 共识] - PD 分离的适用边界 — 当应用必须同时遵守 TTFT 与 TPOT(而非二者可权衡)时,PD 分离优于 chunked-prefills,后者动态分割无法完全解耦
[分类: 共识]
批判性分析
假设前提
立论假设集群具备高速互联(NVLink/PCIe 5.0/RDMA)且规模足够大,使 KV 传输与调度的额外成本可被摊薄;假设 SLO 是刚性约束(Goodput 定义依赖 P90 分位);假设流量特征稳定到值得为两阶段分别配置资源。
论据与逻辑
论据多引自 DistServe、Splitwise、Mooncake 等论文与官方博客,"指标→干扰机制→分离收益→传输优化"的逻辑链完整;但 2P1D 实验是泊松流量模拟,未覆盖突发流量与 P/D 配比动态调节,传输延迟估算也基于理想化带宽假设。
边界与局限
小模型与单卡场景分离收益有限;网络带宽不足时传输开销可能抵消收益;资源孤岛、实例动态配比、角色切换等运维问题仅一笔带过;chunked-prefills 对比较简略,未讨论两类架构的混合方案。
可引用金句
"当应用程序无法在 TTFT 和 TPOT 之间进行权衡,而是要同时遵守这两者时,PD 分离就成为更好的选择。"
"这个实验表明,即便没有引入任何并行优化,仅仅通过简单的分离,Goodput 就提升了约 2 倍。"
总体评价
亮点:
- 覆盖"指标—原理—传输—实现—工业落地"全链路,信息密度高
- 干扰效应(1.8x/12.6x)与 KV 传输开销(17.6ms)均有量化估算
- vLLM KV Connector 与四套工业方案(Mooncake/Dynamo/llm-d/AIBrix)梳理清晰,可作选型参考
不足:
- 数据多转引自论文与官方博客,无作者自身实测
- 对 PD 分离隐性成本(调度复杂度、扩容粒度、资源孤岛)着墨较少
- chunked-prefills 对比简略,未展开混合架构方案
适用场景:LLM 推理系统架构师、Serving 平台工程师做方案选型与技术调研;想建立 Goodput 与 PD 分离全貌认知的研究者。
关联建议:精读 DistServe、Splitwise、TetriInfer、Mooncake 论文原文;跟踪 vLLM V1 KV Connector 演进与 Dynamo 部署实践。
