# 📊 文章摘要:LLM PD 分离背后的架构问题 > **原文**:[2026-08-05_LLM_PD_分离背后的架构问题.md](./2026-08-05_LLM_PD_分离背后的架构问题.md) > **原文链接**:https://zhuanlan.zhihu.com/p/27836625742 > **来源**:知乎专栏 > **作者**:极客博哥(solrex) > **发布日期**:2026-08-05 > **摘要日期**:2026-08-06 > **价值评级**:⭐⭐⭐ 高 --- ## 核心命题 > **架构抉择** — PD 分离落地前必须系统回答的六大架构决策问题,作者以工程视角指出目前尚无理想方案。 --- ## 文章概要 本文系统梳理 PD 分离实现层面的架构选型问题,包括 PD 直连与 KV Cache Store/Pool 之争、KV Cache 是否按层传输、首 token 的 hidden states/token id 处理、Prefiller 与 Decoder 角色互换、Decoder 回填 KV Cache,以及 KV Cache Store 在存储介质、通信协议、分布式架构与数据结构上的设计抉择。其价值在于:主流资料多讲 PD 分离的收益,本文聚焦实现前的决策空间,并对照 vLLM、Mooncake、阿里 RTP-LLM 等现有实现的选择。局限是观点多为工程观察与推测,缺乏实验数据支撑。 --- ## 关键要点 1. **PD 直连 vs KV Cache Store/Pool 是首要抉择** — 直连延迟低但锁定 P/D 节点对应关系、重调度沉没成本高;中间存储多一次传输但容错更好、可兼做 Prefix Caching。Mooncake、vLLM 下一步设计、RTP-LLM 均选后者 `[分类: 共识]` 2. **按层传输是流式化趋势但代价高昂** — Mooncake、RTP-LLM 按层发送 KV Cache 以降低延迟与显存占用时长,但推理引擎改造大、中间存储实现显著复杂(需处理 QPS × 层数的存储预分配与 session 保持);对 MLA 这类 KV Cache 偏小的注意力实现是否值得需看实际收益 `[分类: 争议]` 3. **首 token 的两种计算路径** — 算到 hidden states 免加载 lm_head(DeepSeek V3 为 0.9B 参数,vLLM 采用);算到 token id 传输量小、解码端处理简单(RTP-LLM 采用)`[分类: 争议]` 4. **P/D 角色可转换是负载均衡的前提** — prompt 长度差异导致 P/D 压力失衡,需节点级角色切换或 chunked prefill 兜底;存在中间存储时转换实现难度大幅降低 `[分类: 未探索]` 5. **KV Cache Store 的设计抉择远超传统 KV 存储** — 涉及 VRAM/DRAM/NVMe SSD 介质选择(MQA/MLA 下 SSD 并非不可用)、TCP/NVLink/RDMA/GPU Direct RDMA 单边操作、RPC 控制面与 meta 一致性、分 layer/page 写入及链式 prefix 引用等挑战,目前无开源完整方案 `[分类: 未探索]` 6. **解码端按层接收对调度构成挑战** — 同时请求 P/D 需处理预填充排队观测、解码端显存预申请等同步问题(如 RTP-LLM 在请求进入 prefill 执行阶段时启动解码端显存申请)`[分类: 未探索]` --- ## 批判性分析 ### 假设前提 假设 PD 分离是值得投入的技术方向(以 DistServe、Mooncake、DeepSeek V3 报告为背景);假设读者熟悉 vLLM、Mooncake、RTP-LLM 等实现细节。若场景是单卡、短上下文或小规模部署,文中多数决策问题不成立。 ### 论据与逻辑 以工程观察和开源实现对照支撑论点,逻辑链条完整;但"按层发送对推理引擎的优化应该会有一定的影响"等表述作者自承是"猜测",缺少量化验证;MLA 场景是否值得按层传输也只停留在"要看实际收益"的开放判断。 ### 边界与局限 作者明确承认"目前还没有一个理想的架构方案",并指出结论随场景而异(如同机多卡 PD 直连自有其简单易部署的优势);结论适用于长上下文、大并发、需多机部署的中大型推理服务,不适用于计算配比均衡、故障风险小的同机简单场景。 --- ## 可引用金句 > "整体来看,PD 分离的实现上有很多架构问题需要抉择,目前还没有一个理想的架构方案,或许未来也会是根据不同场景有很多参数化的灵活配置。" --- ## 总体评价 **亮点**: - 系统化提出六大架构决策框架,是目前少见的"实现前决策清单"类文章 - 每种方案均给出利弊与业界实现(Mooncake/vLLM/RTP-LLM/DeepSeek V3)对照 - 边界意识强,明确区分适用与不适用场景 **不足**: - 无实验数据,多处判断停留在推测层面 - 按层发送对 MLA 的收益评估未深入展开 - KV Cache Store 控制面方案(RPC vs RDMA)讨论点到为止 **适用场景**:推理系统架构师、GPU 集群服务化团队在 PD 分离技术选型前的决策参考;理解 Mooncake、vLLM、RTP-LLM 设计取舍时的对照材料。 **关联建议**:结合 DistServe 论文(动机与 SLO 建模)、Mooncake 论文(KVCache 中心调度)阅读;与 akaihaoshuai《LLM关于PD分离的最新实测》互补——前者给决策维度,后者给实测边界。 --- ## 配图 ![-](../../金鹏/20260806/20260806-001.png)