Files
tech/知识/知乎专栏/极客博哥/2026-08-05_LLM_PD_分离背后的架构问题_摘要.md
T
arno c0ba3fb853 文档(金鹏): 2026-08-06 章节 48 篇文章摘要归档
- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇)
- 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/
- 章节重组为 9 个主题分组并挂接摘要引用
2026-08-06 18:00:50 +08:00

4.9 KiB
Raw Blame History

📊 文章摘要:LLM PD 分离背后的架构问题

原文2026-08-05_LLM_PD_分离背后的架构问题.md 原文链接https://zhuanlan.zhihu.com/p/27836625742 来源:知乎专栏 作者:极客博哥(solrex 发布日期2026-08-05 摘要日期2026-08-06 价值评级


核心命题

架构抉择 — PD 分离落地前必须系统回答的六大架构决策问题,作者以工程视角指出目前尚无理想方案。


文章概要

本文系统梳理 PD 分离实现层面的架构选型问题,包括 PD 直连与 KV Cache Store/Pool 之争、KV Cache 是否按层传输、首 token 的 hidden states/token id 处理、Prefiller 与 Decoder 角色互换、Decoder 回填 KV Cache,以及 KV Cache Store 在存储介质、通信协议、分布式架构与数据结构上的设计抉择。其价值在于:主流资料多讲 PD 分离的收益,本文聚焦实现前的决策空间,并对照 vLLM、Mooncake、阿里 RTP-LLM 等现有实现的选择。局限是观点多为工程观察与推测,缺乏实验数据支撑。


关键要点

  1. PD 直连 vs KV Cache Store/Pool 是首要抉择 — 直连延迟低但锁定 P/D 节点对应关系、重调度沉没成本高;中间存储多一次传输但容错更好、可兼做 Prefix Caching。Mooncake、vLLM 下一步设计、RTP-LLM 均选后者 [分类: 共识]
  2. 按层传输是流式化趋势但代价高昂 — Mooncake、RTP-LLM 按层发送 KV Cache 以降低延迟与显存占用时长,但推理引擎改造大、中间存储实现显著复杂(需处理 QPS × 层数的存储预分配与 session 保持);对 MLA 这类 KV Cache 偏小的注意力实现是否值得需看实际收益 [分类: 争议]
  3. 首 token 的两种计算路径 — 算到 hidden states 免加载 lm_headDeepSeek V3 为 0.9B 参数,vLLM 采用);算到 token id 传输量小、解码端处理简单(RTP-LLM 采用)[分类: 争议]
  4. P/D 角色可转换是负载均衡的前提 — prompt 长度差异导致 P/D 压力失衡,需节点级角色切换或 chunked prefill 兜底;存在中间存储时转换实现难度大幅降低 [分类: 未探索]
  5. KV Cache Store 的设计抉择远超传统 KV 存储 — 涉及 VRAM/DRAM/NVMe SSD 介质选择(MQA/MLA 下 SSD 并非不可用)、TCP/NVLink/RDMA/GPU Direct RDMA 单边操作、RPC 控制面与 meta 一致性、分 layer/page 写入及链式 prefix 引用等挑战,目前无开源完整方案 [分类: 未探索]
  6. 解码端按层接收对调度构成挑战 — 同时请求 P/D 需处理预填充排队观测、解码端显存预申请等同步问题(如 RTP-LLM 在请求进入 prefill 执行阶段时启动解码端显存申请)[分类: 未探索]

批判性分析

假设前提

假设 PD 分离是值得投入的技术方向(以 DistServe、Mooncake、DeepSeek V3 报告为背景);假设读者熟悉 vLLM、Mooncake、RTP-LLM 等实现细节。若场景是单卡、短上下文或小规模部署,文中多数决策问题不成立。

论据与逻辑

以工程观察和开源实现对照支撑论点,逻辑链条完整;但"按层发送对推理引擎的优化应该会有一定的影响"等表述作者自承是"猜测",缺少量化验证;MLA 场景是否值得按层传输也只停留在"要看实际收益"的开放判断。

边界与局限

作者明确承认"目前还没有一个理想的架构方案",并指出结论随场景而异(如同机多卡 PD 直连自有其简单易部署的优势);结论适用于长上下文、大并发、需多机部署的中大型推理服务,不适用于计算配比均衡、故障风险小的同机简单场景。


可引用金句

"整体来看,PD 分离的实现上有很多架构问题需要抉择,目前还没有一个理想的架构方案,或许未来也会是根据不同场景有很多参数化的灵活配置。"


总体评价

亮点

  • 系统化提出六大架构决策框架,是目前少见的"实现前决策清单"类文章
  • 每种方案均给出利弊与业界实现(Mooncake/vLLM/RTP-LLM/DeepSeek V3)对照
  • 边界意识强,明确区分适用与不适用场景

不足

  • 无实验数据,多处判断停留在推测层面
  • 按层发送对 MLA 的收益评估未深入展开
  • KV Cache Store 控制面方案(RPC vs RDMA)讨论点到为止

适用场景:推理系统架构师、GPU 集群服务化团队在 PD 分离技术选型前的决策参考;理解 Mooncake、vLLM、RTP-LLM 设计取舍时的对照材料。

关联建议:结合 DistServe 论文(动机与 SLO 建模)、Mooncake 论文(KVCache 中心调度)阅读;与 akaihaoshuai《LLM关于PD分离的最新实测》互补——前者给决策维度,后者给实测边界。


配图

-