Files
tech/知识/知乎专栏/秋月如珪/2026-02-02_大模型学习_PD分离详解_摘要.md
arno c0ba3fb853 文档(金鹏): 2026-08-06 章节 48 篇文章摘要归档
- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇)
- 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/
- 章节重组为 9 个主题分组并挂接摘要引用
2026-08-06 18:00:50 +08:00

4.6 KiB
Raw Permalink Blame History

📊 文章摘要:大模型学习 | PD分离详解

原文2026-02-02_大模型学习_PD分离详解.md 原文链接https://zhuanlan.zhihu.com/p/2001354095441757984 来源:知乎专栏 作者:秋月如珪 发布日期2026-02-02 摘要日期2026-08-06 价值评级


核心命题

阶段解耦 — 系统讲解 PD 分离的动机、传输机制与工业实践,并给出明确的适用边界与替代方案。


文章概要

本文系统讲解 PD 分离:从混合部署的计算争抢、显存叠加、batching 冲突说明动机,用 A100/13B 的 SLO 数据(TTFT 约束约 3 RPS、TPOT 约束约 1.6 RPS)说明 Goodput 由双指标最小值决定;随后展开 KV Cache 三级传输粒度(请求级/层级/块级)、四种传输 Connector、独立 batching 与差异化并行策略,并对比 Dynamo、vLLM、llm-d、Mooncake 四大工业实践。价值在于结构完整、决策导向,且专门讨论了局限与 Chunked-Prefills 折中方案。局限是多数数据未标注来源,对未来"默认部署范式"的预测偏乐观。


关键要点

  1. 混合部署三类冲突 — 计算资源争抢致 TPOT 抖动、Prefill 中间结果与 KV Cache 显存叠加易 OOM、batching 策略冲突(Prefill 适合小 batchDecode 适合大 batch[分类: 共识]
  2. Goodput 由双 SLO 的较紧者决定 — A100/13B 下 TTFT0.4s)可支持约 3 RPS、TPOT0.04s)仅约 1.6 RPS2P1D 配置可将 Goodput 提升至 3.3 RPS/GPU,约 2 倍 [分类: 共识]
  3. KV Cache 传输三级粒度 — 请求级实现简单但大 prompt 传输延迟高;层级可传输计算重叠、提前启动 Decode,但小 prompt 场景同步开销可能超过收益(Splitwise);块级保持 GPU 计算饱和但实现复杂度高(TetriInfer)[分类: 共识]
  4. 独立 batching 策略 — Prefill 保持小 batch1-4 请求)避免线性增加 TTFTDecode 采用大 batch64-128)提升计算强度与带宽利用率 [分类: 共识]
  5. 差异化并行 — Prefill 用张量并行满足严格 TTFT,Decode 用流水线/数据并行提升吞吐 [分类: 共识]
  6. 工业界四案例 — DynamoPlanner 动态决策 + Smart Router 缓存感知路由 + NIXL)、vLLM V1KVConnector 抽象 + MultiConnector 冗余)、llm-dK8s 原生 + Inference Gateway)、Mooncake(分层 KV Cache 池,长上下文吞吐最高提升 525%)[分类: 共识]
  7. 明确局限与替代方案 — KV 传输 overhead、双集群状态同步与故障恢复复杂度;延迟要求不极端的场景 Chunked-Prefills 是更简单的折中 [分类: 共识]

批判性分析

假设前提

假设读者关注高性能 LLM 服务的生产级部署;假设 TTFT/TPOT 双 SLO 是服务首要优化目标;假设两阶段硬件解耦的成本可控。

论据与逻辑

SLO 数据直观且有推导逻辑(Goodput 取两者最小值),但未标注出处(疑似来自 DistServe 论文),削弱了可信度;Mooncake 的 525% 与 75% 数据有论文支撑,其余性能数字(如 2 倍 Goodput 提升)缺乏来源。

边界与局限

作者专门列出局限与替代方案,边界意识较好;但"PD 分离可能成为下一代大模型服务的默认部署范式"属个人预测,缺乏论证,与 akaihaoshuai 实测中"普通场景没必要折腾"的结论存在张力。


可引用金句

"系统的Goodput(有效吞吐)由两者最小值决定,即1.6 RPS/GPU。"

"PD分离代表了LLM推理架构从统一处理向阶段特化演进的重要趋势。"


总体评价

亮点

  • 知识结构完整(动机→机制→协议→实践→边界),传输粒度三级表格与 Connector 对比实用
  • 有独立的"局限与替代方案"章节,Chunked-Prefills 折中建议实操性强
  • 四大工业实践(Dynamo/vLLM/llm-d/Mooncake)覆盖了当前主流方案

不足

  • 关键性能数据缺出处,需溯源验证
  • 个别技术细节与来源论文混编(如 Splitwise、TetriInfer 方案名)
  • "默认部署范式"等预测性论断缺乏论证支撑

适用场景:需要系统建立 PD 分离知识框架的工程师与学习者;PD 分离方案调研与技术汇报的材料底稿。

关联建议:数据溯源阅读 DistServe 论文原文;实践侧对照 akaihaoshuai 的实测阈值与极客博哥的架构决策清单;跟进 vLLM Disaggregated Serving 与 Dynamo 官方文档。


配图

-