# 📊 文章摘要:大模型学习 | PD分离详解 > **原文**:[2026-02-02_大模型学习_PD分离详解.md](./2026-02-02_大模型学习_PD分离详解.md) > **原文链接**:https://zhuanlan.zhihu.com/p/2001354095441757984 > **来源**:知乎专栏 > **作者**:秋月如珪 > **发布日期**:2026-02-02 > **摘要日期**:2026-08-06 > **价值评级**:⭐⭐ 中 --- ## 核心命题 > **阶段解耦** — 系统讲解 PD 分离的动机、传输机制与工业实践,并给出明确的适用边界与替代方案。 --- ## 文章概要 本文系统讲解 PD 分离:从混合部署的计算争抢、显存叠加、batching 冲突说明动机,用 A100/13B 的 SLO 数据(TTFT 约束约 3 RPS、TPOT 约束约 1.6 RPS)说明 Goodput 由双指标最小值决定;随后展开 KV Cache 三级传输粒度(请求级/层级/块级)、四种传输 Connector、独立 batching 与差异化并行策略,并对比 Dynamo、vLLM、llm-d、Mooncake 四大工业实践。价值在于结构完整、决策导向,且专门讨论了局限与 Chunked-Prefills 折中方案。局限是多数数据未标注来源,对未来"默认部署范式"的预测偏乐观。 --- ## 关键要点 1. **混合部署三类冲突** — 计算资源争抢致 TPOT 抖动、Prefill 中间结果与 KV Cache 显存叠加易 OOM、batching 策略冲突(Prefill 适合小 batch,Decode 适合大 batch)`[分类: 共识]` 2. **Goodput 由双 SLO 的较紧者决定** — A100/13B 下 TTFT(0.4s)可支持约 3 RPS、TPOT(0.04s)仅约 1.6 RPS;2P1D 配置可将 Goodput 提升至 3.3 RPS/GPU,约 2 倍 `[分类: 共识]` 3. **KV Cache 传输三级粒度** — 请求级实现简单但大 prompt 传输延迟高;层级可传输计算重叠、提前启动 Decode,但小 prompt 场景同步开销可能超过收益(Splitwise);块级保持 GPU 计算饱和但实现复杂度高(TetriInfer)`[分类: 共识]` 4. **独立 batching 策略** — Prefill 保持小 batch(1-4 请求)避免线性增加 TTFT;Decode 采用大 batch(64-128)提升计算强度与带宽利用率 `[分类: 共识]` 5. **差异化并行** — Prefill 用张量并行满足严格 TTFT,Decode 用流水线/数据并行提升吞吐 `[分类: 共识]` 6. **工业界四案例** — Dynamo(Planner 动态决策 + Smart Router 缓存感知路由 + NIXL)、vLLM V1(KVConnector 抽象 + MultiConnector 冗余)、llm-d(K8s 原生 + Inference Gateway)、Mooncake(分层 KV Cache 池,长上下文吞吐最高提升 525%)`[分类: 共识]` 7. **明确局限与替代方案** — KV 传输 overhead、双集群状态同步与故障恢复复杂度;延迟要求不极端的场景 Chunked-Prefills 是更简单的折中 `[分类: 共识]` --- ## 批判性分析 ### 假设前提 假设读者关注高性能 LLM 服务的生产级部署;假设 TTFT/TPOT 双 SLO 是服务首要优化目标;假设两阶段硬件解耦的成本可控。 ### 论据与逻辑 SLO 数据直观且有推导逻辑(Goodput 取两者最小值),但未标注出处(疑似来自 DistServe 论文),削弱了可信度;Mooncake 的 525% 与 75% 数据有论文支撑,其余性能数字(如 2 倍 Goodput 提升)缺乏来源。 ### 边界与局限 作者专门列出局限与替代方案,边界意识较好;但"PD 分离可能成为下一代大模型服务的默认部署范式"属个人预测,缺乏论证,与 akaihaoshuai 实测中"普通场景没必要折腾"的结论存在张力。 --- ## 可引用金句 > "系统的Goodput(有效吞吐)由两者最小值决定,即1.6 RPS/GPU。" > "PD分离代表了LLM推理架构从统一处理向阶段特化演进的重要趋势。" --- ## 总体评价 **亮点**: - 知识结构完整(动机→机制→协议→实践→边界),传输粒度三级表格与 Connector 对比实用 - 有独立的"局限与替代方案"章节,Chunked-Prefills 折中建议实操性强 - 四大工业实践(Dynamo/vLLM/llm-d/Mooncake)覆盖了当前主流方案 **不足**: - 关键性能数据缺出处,需溯源验证 - 个别技术细节与来源论文混编(如 Splitwise、TetriInfer 方案名) - "默认部署范式"等预测性论断缺乏论证支撑 **适用场景**:需要系统建立 PD 分离知识框架的工程师与学习者;PD 分离方案调研与技术汇报的材料底稿。 **关联建议**:数据溯源阅读 DistServe 论文原文;实践侧对照 akaihaoshuai 的实测阈值与极客博哥的架构决策清单;跟进 vLLM Disaggregated Serving 与 Dynamo 官方文档。 --- ## 配图 ![-](../../金鹏/20260806/20260806-001.png)