Files
tech/知识/知乎专栏/秋月如珪/2026-02-02_大模型学习_PD分离详解_摘要.md
T
arno c0ba3fb853 文档(金鹏): 2026-08-06 章节 48 篇文章摘要归档
- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇)
- 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/
- 章节重组为 9 个主题分组并挂接摘要引用
2026-08-06 18:00:50 +08:00

82 lines
4.6 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 📊 文章摘要:大模型学习 | PD分离详解
> **原文**[2026-02-02_大模型学习_PD分离详解.md](./2026-02-02_大模型学习_PD分离详解.md)
> **原文链接**https://zhuanlan.zhihu.com/p/2001354095441757984
> **来源**:知乎专栏
> **作者**:秋月如珪
> **发布日期**2026-02-02
> **摘要日期**2026-08-06
> **价值评级**:⭐⭐ 中
---
## 核心命题
> **阶段解耦** — 系统讲解 PD 分离的动机、传输机制与工业实践,并给出明确的适用边界与替代方案。
---
## 文章概要
本文系统讲解 PD 分离:从混合部署的计算争抢、显存叠加、batching 冲突说明动机,用 A100/13B 的 SLO 数据(TTFT 约束约 3 RPS、TPOT 约束约 1.6 RPS)说明 Goodput 由双指标最小值决定;随后展开 KV Cache 三级传输粒度(请求级/层级/块级)、四种传输 Connector、独立 batching 与差异化并行策略,并对比 Dynamo、vLLM、llm-d、Mooncake 四大工业实践。价值在于结构完整、决策导向,且专门讨论了局限与 Chunked-Prefills 折中方案。局限是多数数据未标注来源,对未来"默认部署范式"的预测偏乐观。
---
## 关键要点
1. **混合部署三类冲突** — 计算资源争抢致 TPOT 抖动、Prefill 中间结果与 KV Cache 显存叠加易 OOM、batching 策略冲突(Prefill 适合小 batchDecode 适合大 batch`[分类: 共识]`
2. **Goodput 由双 SLO 的较紧者决定** — A100/13B 下 TTFT0.4s)可支持约 3 RPS、TPOT0.04s)仅约 1.6 RPS2P1D 配置可将 Goodput 提升至 3.3 RPS/GPU,约 2 倍 `[分类: 共识]`
3. **KV Cache 传输三级粒度** — 请求级实现简单但大 prompt 传输延迟高;层级可传输计算重叠、提前启动 Decode,但小 prompt 场景同步开销可能超过收益(Splitwise);块级保持 GPU 计算饱和但实现复杂度高(TetriInfer)`[分类: 共识]`
4. **独立 batching 策略** — Prefill 保持小 batch1-4 请求)避免线性增加 TTFTDecode 采用大 batch64-128)提升计算强度与带宽利用率 `[分类: 共识]`
5. **差异化并行** — Prefill 用张量并行满足严格 TTFT,Decode 用流水线/数据并行提升吞吐 `[分类: 共识]`
6. **工业界四案例** — DynamoPlanner 动态决策 + Smart Router 缓存感知路由 + NIXL)、vLLM V1KVConnector 抽象 + MultiConnector 冗余)、llm-dK8s 原生 + Inference Gateway)、Mooncake(分层 KV Cache 池,长上下文吞吐最高提升 525%)`[分类: 共识]`
7. **明确局限与替代方案** — KV 传输 overhead、双集群状态同步与故障恢复复杂度;延迟要求不极端的场景 Chunked-Prefills 是更简单的折中 `[分类: 共识]`
---
## 批判性分析
### 假设前提
假设读者关注高性能 LLM 服务的生产级部署;假设 TTFT/TPOT 双 SLO 是服务首要优化目标;假设两阶段硬件解耦的成本可控。
### 论据与逻辑
SLO 数据直观且有推导逻辑(Goodput 取两者最小值),但未标注出处(疑似来自 DistServe 论文),削弱了可信度;Mooncake 的 525% 与 75% 数据有论文支撑,其余性能数字(如 2 倍 Goodput 提升)缺乏来源。
### 边界与局限
作者专门列出局限与替代方案,边界意识较好;但"PD 分离可能成为下一代大模型服务的默认部署范式"属个人预测,缺乏论证,与 akaihaoshuai 实测中"普通场景没必要折腾"的结论存在张力。
---
## 可引用金句
> "系统的Goodput(有效吞吐)由两者最小值决定,即1.6 RPS/GPU。"
> "PD分离代表了LLM推理架构从统一处理向阶段特化演进的重要趋势。"
---
## 总体评价
**亮点**
- 知识结构完整(动机→机制→协议→实践→边界),传输粒度三级表格与 Connector 对比实用
- 有独立的"局限与替代方案"章节,Chunked-Prefills 折中建议实操性强
- 四大工业实践(Dynamo/vLLM/llm-d/Mooncake)覆盖了当前主流方案
**不足**
- 关键性能数据缺出处,需溯源验证
- 个别技术细节与来源论文混编(如 Splitwise、TetriInfer 方案名)
- "默认部署范式"等预测性论断缺乏论证支撑
**适用场景**:需要系统建立 PD 分离知识框架的工程师与学习者;PD 分离方案调研与技术汇报的材料底稿。
**关联建议**:数据溯源阅读 DistServe 论文原文;实践侧对照 akaihaoshuai 的实测阈值与极客博哥的架构决策清单;跟进 vLLM Disaggregated Serving 与 Dynamo 官方文档。
---
## 配图
![-](../../金鹏/20260806/20260806-001.png)