# 📊 文章摘要:LLM 做 PD 分离后,怎么更慢了? > **原文**:[2026-08-05_LLM做PD分离后怎么更慢了_丁师兄.md](./2026-08-05_LLM做PD分离后怎么更慢了_丁师兄.md) > **原文链接**:https://mp.weixin.qq.com/s/0HlmtIuPGU7QE5r1fyhcsA > **来源**:微信公众平台(丁师兄) > **作者**:丁师兄(专注智能驾驶大模型,LLM 面试干货分享) > **发布日期**:2026-08-05(原文未标注日期,按下载日占位) > **摘要日期**:2026-08-06 > **价值评级**:⭐⭐⭐ 高 --- ## 核心命题 > **落地五坑** — 从生产环境视角系统列出 PD 分离的 5 大落地问题(KV 传输、负载失衡、调度复杂度、显存管理、P:D 敏感性),是与清一色"红利派"文章互补的"代价派"清单。 --- ## 文章概要 本文以面试题"PD 分离实际落地会遇到什么问题"切入,系统梳理了 PD 分离生产落地的 5 大坑:KV Cache 传输开销(Llama-3.1-70B 单请求 1.34GB,10GbE 传 1 秒以上,需 IB/NVLink 级互联)、生产者-消费者不平衡(workload 动态变化使静态 P:D 配置失效)、调度复杂度飙升(双实例决策与气泡问题)、显存压力与跨节点生命周期管理、P:D 比例对 workload 的高度敏感性(性能曲线交叉、断崖式下跌)。其价值在于提供了本批文章中唯一完整的"反面清单",并给出了可直接计算的量化示例;局限是数字多为估算与二手引用,无第一手实验,且"如何解决"仅点到业界方案名称。 --- ## 关键要点 1. **KV Cache 传输是最大坑** — Llama-3.1-70B 单请求 KV 约 1.34GB,TTFT 500ms 预算下 Prefill 占 200ms 后仅剩约 300ms 传输窗口:10GbE 需 1 秒+、25GbE 勉强 400 多毫秒,只有 InfiniBand/NVLink 才能压到几十毫秒级;"传输开销超过分离收益则整个架构白搭"。 `[分类: 共识]` 2. **P:D 比例无万能配置** — 短 prompt 长输出需 1P3D,长上下文需 3P1D;真实业务流量动态变化,静态配置必出现一边闲置一边排队;论文与 Medium 实验均显示不同 Prompt/Output 比例下性能曲线交叉。 `[分类: 共识]` 3. **调度复杂度飙升** — 调度器从单队列变为实时决策"请求分给哪个 P、KV 传给哪个 D";生产者-消费者同步在高并发下产生气泡;Mooncake 的三层架构(P/D/Caching 集群)对小团队维护成本高。 `[分类: 共识]` 4. **显存管理与碎片化** — KV Cache 生命周期跨越两个节点,PagedAttention 只能缓解单节点碎片;P/D 两侧的释放与复用时机协调不当会出现"一边频繁 OOM、另一边大量闲置"。 `[分类: 共识]` 5. **瓶颈切换是突变而非平滑** — workload 从 Decode 密集切到 Prefill 密集时性能可能断崖式下跌;动态调整 P:D 又依赖实时监控与调度,与问题 3 形成循环依赖——这是动态 P:D 配比至今未成熟解决的深层原因。 `[分类: 未探索]` 6. **应对方向的业界共识** — 高速网络、智能调度算法、动态伸缩、KV Cache 压缩与复用,并以 DistServe、Mooncake 为前沿实践代表。 `[分类: 共识]` --- ## 批判性分析 ### 假设前提 立论假设 PD 分离的收益已成立(文章未质疑分离本身,只质疑落地方式);同时隐含假设读者已具备 PD 分离基本概念;"动态 workload"是常态这一前提放大了静态配比的缺陷,但未讨论可预测负载(如离线批处理)场景下静态配比的适用性。 ### 论据与逻辑 五个问题维度划分清晰、逻辑自洽,KV 传输的量化示例(1.34GB、300ms 窗口、各网络档位耗时)可直接复算,说服力强。但 P:D 敏感性结论仅转述"有篇论文"与"一篇 Medium 文章",未给出论文名与数据来源,引用严谨性不足;部分数字(10GbE 传 1 秒多)为估算,未提供计算公式;"问题清单"完整但"解决路径"止于名词罗列。 ### 边界与局限 结论针对"动态生产流量下的在线推理"场景,对负载稳定的离线批量场景不适用;KV 传输开销的判断以 Llama-3.1-70B 为样本,对 KV 更小的 MoE 模型(如 DeepSeek)或 KV 压缩技术下的传输量需重新评估——其悲观程度与 DistServe 论文"传输可隐藏"的乐观结论形成对照,真实答案取决于网络与模型的具体组合;文章未覆盖传输与计算重叠(overlap)等已有缓解技术。 --- ## 可引用金句 > "这道题考的不是让你背八股,而是看你有没有真正理解生产环境的复杂性。" > "如果传输开销超过了分离带来的性能收益,整个架构就白搭了。" > "没有万能配置,必须根据实际 workload 调整。" --- ## 总体评价 **亮点**: - 本批 PD 分离文章中唯一的系统性"代价清单",与红利派文章形成强互补 - KV 传输量化示例具体可复算(1.34GB、300ms 窗口),可直接用于面试与方案评估 - 明确点出 P:D 敏感性、瓶颈突变、动态调整循环依赖等常被忽视的深层问题 **不足**: - 关键结论依赖未具名的二手引用,严谨性不足 - 无第一手实验数据,数字多为估算 - "怎么解决"止于业界方案名称,缺少可操作建议 **适用场景**:准备 LLM 推理面试的候选人;正在评估 PD 分离方案的架构师与运维团队(决策前的风险清单);与红利派文章对照理解 PD 分离全貌的读者。 **关联建议**:与本批新智元 DistServe 文章对照阅读,可见"传输可隐藏 vs 传输是大坑"的张力本质是网络条件与模型规模假设不同;与本批 marcus 的 vLLM 源码文章串联,可理解调度复杂度在代码层的具体表现;进一步可阅读 Mooncake 论文(KVCache 复用与缓存集群)与 DistServe 论文中关于调度算法的章节。 --- ## 配图 ![-](../../金鹏/20260806/20260806-003.png)