- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇) - 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/ - 章节重组为 9 个主题分组并挂接摘要引用
4.6 KiB
📊 文章摘要:大模型学习 | PD分离详解
原文:2026-02-02_大模型学习_PD分离详解.md 原文链接:https://zhuanlan.zhihu.com/p/2001354095441757984 来源:知乎专栏 作者:秋月如珪 发布日期:2026-02-02 摘要日期:2026-08-06 价值评级:⭐⭐ 中
核心命题
阶段解耦 — 系统讲解 PD 分离的动机、传输机制与工业实践,并给出明确的适用边界与替代方案。
文章概要
本文系统讲解 PD 分离:从混合部署的计算争抢、显存叠加、batching 冲突说明动机,用 A100/13B 的 SLO 数据(TTFT 约束约 3 RPS、TPOT 约束约 1.6 RPS)说明 Goodput 由双指标最小值决定;随后展开 KV Cache 三级传输粒度(请求级/层级/块级)、四种传输 Connector、独立 batching 与差异化并行策略,并对比 Dynamo、vLLM、llm-d、Mooncake 四大工业实践。价值在于结构完整、决策导向,且专门讨论了局限与 Chunked-Prefills 折中方案。局限是多数数据未标注来源,对未来"默认部署范式"的预测偏乐观。
关键要点
- 混合部署三类冲突 — 计算资源争抢致 TPOT 抖动、Prefill 中间结果与 KV Cache 显存叠加易 OOM、batching 策略冲突(Prefill 适合小 batch,Decode 适合大 batch)
[分类: 共识] - Goodput 由双 SLO 的较紧者决定 — A100/13B 下 TTFT(0.4s)可支持约 3 RPS、TPOT(0.04s)仅约 1.6 RPS;2P1D 配置可将 Goodput 提升至 3.3 RPS/GPU,约 2 倍
[分类: 共识] - KV Cache 传输三级粒度 — 请求级实现简单但大 prompt 传输延迟高;层级可传输计算重叠、提前启动 Decode,但小 prompt 场景同步开销可能超过收益(Splitwise);块级保持 GPU 计算饱和但实现复杂度高(TetriInfer)
[分类: 共识] - 独立 batching 策略 — Prefill 保持小 batch(1-4 请求)避免线性增加 TTFT;Decode 采用大 batch(64-128)提升计算强度与带宽利用率
[分类: 共识] - 差异化并行 — Prefill 用张量并行满足严格 TTFT,Decode 用流水线/数据并行提升吞吐
[分类: 共识] - 工业界四案例 — Dynamo(Planner 动态决策 + Smart Router 缓存感知路由 + NIXL)、vLLM V1(KVConnector 抽象 + MultiConnector 冗余)、llm-d(K8s 原生 + Inference Gateway)、Mooncake(分层 KV Cache 池,长上下文吞吐最高提升 525%)
[分类: 共识] - 明确局限与替代方案 — KV 传输 overhead、双集群状态同步与故障恢复复杂度;延迟要求不极端的场景 Chunked-Prefills 是更简单的折中
[分类: 共识]
批判性分析
假设前提
假设读者关注高性能 LLM 服务的生产级部署;假设 TTFT/TPOT 双 SLO 是服务首要优化目标;假设两阶段硬件解耦的成本可控。
论据与逻辑
SLO 数据直观且有推导逻辑(Goodput 取两者最小值),但未标注出处(疑似来自 DistServe 论文),削弱了可信度;Mooncake 的 525% 与 75% 数据有论文支撑,其余性能数字(如 2 倍 Goodput 提升)缺乏来源。
边界与局限
作者专门列出局限与替代方案,边界意识较好;但"PD 分离可能成为下一代大模型服务的默认部署范式"属个人预测,缺乏论证,与 akaihaoshuai 实测中"普通场景没必要折腾"的结论存在张力。
可引用金句
"系统的Goodput(有效吞吐)由两者最小值决定,即1.6 RPS/GPU。"
"PD分离代表了LLM推理架构从统一处理向阶段特化演进的重要趋势。"
总体评价
亮点:
- 知识结构完整(动机→机制→协议→实践→边界),传输粒度三级表格与 Connector 对比实用
- 有独立的"局限与替代方案"章节,Chunked-Prefills 折中建议实操性强
- 四大工业实践(Dynamo/vLLM/llm-d/Mooncake)覆盖了当前主流方案
不足:
- 关键性能数据缺出处,需溯源验证
- 个别技术细节与来源论文混编(如 Splitwise、TetriInfer 方案名)
- "默认部署范式"等预测性论断缺乏论证支撑
适用场景:需要系统建立 PD 分离知识框架的工程师与学习者;PD 分离方案调研与技术汇报的材料底稿。
关联建议:数据溯源阅读 DistServe 论文原文;实践侧对照 akaihaoshuai 的实测阈值与极客博哥的架构决策清单;跟进 vLLM Disaggregated Serving 与 Dynamo 官方文档。
