# 📊 文章摘要:Lesson 06:PD 分离推理架构详解(AI Infra 学习课程) > **原文**:[2026-08-06_Lesson_06_PD分离推理架构详解.md](./2026-08-06_Lesson_06_PD分离推理架构详解.md) > **原文链接**:https://github.com/cr7258/ai-infra-learning/tree/main/lesson/06-disaggregating-prefill-and-decoding > **来源**:GitHub(cr7258/ai-infra-learning) > **作者**:cr7258 > **发布日期**:2026-08-06 > **摘要日期**:2026-08-06 > **价值评级**:⭐⭐⭐ 高 --- ## 核心命题 > **PD 分离详解** — 用 Goodput 指标重新审视 LLM 推理架构:prefill 与 decode 分离不仅消除阶段干扰,还能在满足 TTFT/TPOT SLO 前提下将有效吞吐量提升约 2 倍(仅靠分离、不加任何并行优化)。 --- ## 文章概要 本文是 AI Infra 学习课程第 6 课,系统讲解 PD(prefill-decode)分离推理架构:从 Throughput 与 Goodput 的指标辨析切入,用 DistServe 论文数据量化 prefill/decode 共置干扰(prompt 128 tokens 时 decode 延迟增 1.8 倍、1024 tokens 时达 12.6 倍),以 2P1D 实验演示 Goodput 从 1.6 提升至 3.3 rps/GPU;随后展开分离架构的优化方向(算力/存储特性、batching、并行策略)、KV Cache 传输的全栈分析(开销估算、中心存储 vs P2P、Direct/Direct-NIC/Indirect 三类链路、请求级/层级/块级三种粒度)、vLLM KV Connector 五种实现详解、工业界四项目对比(Mooncake/Dynamo/llm-d/AIBrix),并以 chunked-prefills 与 PD 分离的优劣对比收尾。价值在于:数据详实、链路完整,是理解 PD 分离的优质入门与选型参考。局限在于:部分实验数据出自论文而非作者实测,对传输开销的乐观结论依赖高速网络假设。 --- ## 关键要点 1. **Goodput 优于 Throughput 作为服务指标** — Goodput 指满足 SLO(如 P90 TTFT < 200ms 且 P90 TPOT < 50ms)前提下的有效请求数;10 RPS 吞吐可能只有 3 RPS 有效产出,高吞吐≠好体验,评价服务应同时看吞吐与 SLO 达成。 `[分类: 范式突破]` 2. **共置干扰有量化证据** — prefill 与 decode 混批时,prompt 128 tokens 使 decode 延迟增约 1.8 倍、1024 tokens 时增至 12.6 倍,且同时满足双 SLO 会导致过度配置——这是 PD 分离的必要性论证核心。 `[分类: 共识]` 3. **分离本身即带来约 2 倍 Goodput 提升** — 单卡共置 Goodput 1.6 rps/GPU vs 2P1D 分离 3.3 rps/GPU,且分离后可分别定制并行策略(prefill 偏张量并行保 TTFT,decode 偏数据/流水线并行保吞吐)。 `[分类: 共识]` 4. **KV 传输开销可以被隐藏** — 8 通道 PCIe 5.0 下 2048 tokens 的 KV 传输约 17.6ms,低于单次 decode 步骤(30-50ms);层级传输(Splitwise)与计算重叠可进一步隐藏开销,但层级粒度在小 prompt 场景会引入同步干扰。 `[分类: 共识]` 5. **PD 分离 vs chunked-prefills 是权衡而非胜负** — chunked-prefills 吞吐调度简单、可提升 decode 批计算强度(MFU),但无法完全解耦两阶段、TTFT 与 TPOT 互相妥协;当应用必须同时满足双 SLO 时 PD 分离更优。这是全文边界意识最强的部分。 `[分类: 争议]` 6. **vLLM KV Connector 是事实标准抽象** — 5 种 connector(SharedStorage/NCCL P2P/NIXL/LMCache/Multi)覆盖文件系统、RDMA、外部缓存、混合冗余四类路径,`KVConnectorBase_V1` 的 scheduler/worker 职责划分即社区当前实现的基线。 `[分类: 共识]` --- ## 批判性分析 ### 假设前提 - 传输开销"可被隐藏"的结论建立在高速互联假设上(NVLink、PCIe 5.0、RDMA),对普通以太网集群(10/25/40Gbps)不成立,此时 KV 传输反而成为瓶颈——文中未对低速网络场景做等价估算; - 假设请求有明确且独立的 TTFT/TPOT SLO;对只有单一延迟要求或短 prompt 为主的工作负载,PD 分离的收益空间会显著收窄; - 假设 prefill/decode 的比例可通过资源配比灵活调节(2P1D),实际中流量波动要求动态调度能力,本文未展开。 ### 论据与逻辑 - 论据质量总体较高:干扰数据(1.8x/12.6x)、Goodput 计算(含完整算式)、17.6ms 传输估算均给出可追溯出处(DistServe/Splitwise/TetriInfer 论文),教程对原文复述忠实;vLLM connector 部分为代码级事实描述,可信度最高。需注意:2P1D 实验(Goodput 1.6→3.3)来自论文模拟环境而非作者实测;工业界项目部分(Mooncake 525% 提升、75% 请求)转引自项目论文/自述,属二手数据。 ### 边界与局限 - 适用场景:具备 GPU 高速互联(NVLink/RDMA)的大规模集群、请求需同时满足严格 TTFT 与 TPOT 的服务(实时对话 + 长文档混合负载);PD 分离会引入额外的编排复杂度(路由、队列、传输),中小规模或单 SLO 场景未必划算; - 中心存储与 P2P 各有短板(中心存储性能与维护成本、P2P 扩展性与链路稳定),文中已给出但未量化; - 未覆盖:PD 分离下的容错与弹性、跨集群部署、以及 PD 分离对训练/RL 场景的延伸(可参考 Mooncake 权重传输方向)。 --- ## 可引用金句 > "当应用程序无法在 TTFT 和 TPOT 之间进行权衡,而是要同时遵守这两者时,PD 分离就成为更好的选择。" --- ## 总体评价 **亮点**: - 逻辑链条完整:指标问题 → 干扰证据 → 分离方案 → 传输全栈 → 工程实现 → 方案对比,一篇文章讲透 PD 分离 - 数据有出处、计算有过程,并明确区分论文数据与工程事实,论据纪律良好 - vLLM KV Connector 代码级详解与四工业项目横向对比,具备直接工程参考价值 - 边界意识突出:对 chunked-prefills 的对比是行业争议点的诚实呈现 **不足**: - 传输开销结论依赖高速网络假设,低速网络场景缺失 - 工业界性能数字转引自项目自述,未标注可信度级别 - 未涉及容错、动态资源配比、跨集群等生产落地细节 **适用场景**:LLM 推理架构选型的工程师与架构师(判断"何时该上 PD 分离");vLLM 二次开发者的 connector 参考;AI Infra 学习者的体系化入门材料。 **关联建议**:延伸阅读 DistServe/Splitwise/TetriInfer/MemServe/Mooncake 五篇论文原文;对照 vLLM 官方 disagg_prefill 文档实操;结合 Mooncake、NVIDIA Dynamo、llm-d、AIBrix 四项目文档评估工程化路径;关注社区关于 chunked-prefills 与 PD 分离融合(如 SGLang 的演进)的最新讨论。 --- ## 配图 ![-](../../金鹏/20260806/20260806-005.png)