# 📊 文章摘要:大模型系列:深度解析 Prefill-Decode 分离式部署架构 > **原文**:[2025-06-17_大模型系列_深度解析_Prefill-Decode_分离式部署架构.md](./2025-06-17_大模型系列_深度解析_Prefill-Decode_分离式部署架构.md) > **原文链接**:https://zhuanlan.zhihu.com/p/1918334902492963669 > **来源**:知乎专栏 > **作者**:猫先生 > **发布日期**:2025-06-17 > **摘要日期**:2026-08-06 > **价值评级**:⭐⭐ 中 --- ## 核心命题 > **阶段特化** — 从 Prefill/Decode 两阶段的资源特性差异推导 PD 分离原理,并梳理其论文谱系与通信底座。 --- ## 文章概要 本文是 Prefill-Decode 分离式部署的深度科普:先阐明 Prefill 计算密集(compute-bound)与 Decode 内存带宽密集(bandwidth-bound)的本质差异,解释 KV Cache"以存换算"的机理,再介绍 PD 分离原理与 NCCL/NIXL 通信协议,追溯 SARATHI、DistServe、LoongServe、Mooncake、Speculative Prefill、LServe 六篇论文的演进脉络,最后拆解 vLLM 的 Proxy/prefill/decode 三组件架构。价值在于概念讲解透彻、论文谱系完整并附源码链接,是入门 PD 分离的良好综述。局限是无一手实验数据,个别表述不够严谨(如"显存随上下文指数级上升"实为线性增长)。 --- ## 关键要点 1. **两阶段资源特性根本不同** — Prefill 高并行、矩阵乘法为主、计算密集;Decode 逐 token 串行、频繁访问 KV Cache、内存带宽密集,这是 PD 分离的立论基础 `[分类: 共识]` 2. **拆分的根本原因** — 输入 prompt 一次性完整提供、适合并行;输出 token 未知、只能逐个串行。KV Cache 复用使 Decode 的 attention 复杂度降低一个量级,实现"以存换算" `[分类: 共识]` 3. **混合部署的资源错配** — 请求的 Prefill 长度与 Decode 长度不匹配时,同一 GPU 需同时承担高算力与高带宽需求,难以发挥最佳性能 `[分类: 共识]` 4. **通信底座 NCCL 与 NIXL** — NCCL 适合单机/高带宽集群内的 GPU-GPU 通信;NIXL 是面向推理系统的"远程 NCCL"扩展层,专为跨节点 PD 分离的 KV Cache 远程传输设计 `[分类: 共识]` 5. **论文谱系六连** — SARATHI(分块预填充+最大解码批处理,2023.8)→ DistServe(PD 解耦与 goodput 优化,2024.1)→ LoongServe(弹性序列并行,2024.4)→ Mooncake(KVCache 中心化分解架构,2024.6)→ Speculative Prefill(TTFT 加速,2025.2)→ LServe(混合稀疏注意力,2025.2) `[分类: 共识]` 6. **vLLM 的 PD 分离三组件** — Proxy API server 负责路由,prefill 实例只生成 KV Cache,decode 实例执行 drop_select 获取 KV 并跳过 prefill 直接生成 token `[分类: 共识]` --- ## 批判性分析 ### 假设前提 假设读者已具备 Transformer 与 KV Cache 基础知识;假设 PD 分离收益适用于大规模部署场景,而本文对硬件资源门槛与实施成本着墨不多。 ### 论据与逻辑 以论文结论转述为主,出处清晰(六篇论文均附 arxiv 链接),作为综述论据充分;但"显存占用模式随上下文增长指数级上升"与 KV Cache 线性增长的客观事实不符,属表述疏漏,削弱了表格的严谨性。 ### 边界与局限 仅一般性提及"适用于对时延有严格要求的场景",未讨论 P/D 配比、传输延迟隐藏、异构硬件等工程边界;对 PD 分离带来的系统复杂度与成本上升几乎未涉及。 --- ## 可引用金句 > "Prefill 和 Decode 阶段不仅在结构上不同,在性能瓶颈上也大相径庭" > "LLM生成文本的过程本质上是给定上下文,逐词预测下一个词。但在实现上,这个过程被明确地分成两个阶段" --- ## 总体评价 **亮点**: - 概念讲解由浅入深,Prefill/Decode 对比表格清晰直观 - 论文谱系(2023.8–2025.2)梳理完整并附代码链接,索引价值高 - NCCL/NIXL 通信协议对比实用 **不足**: - 无一手数据,全部结论为二手转述 - 个别技术表述不严谨(显存增长量级) - 缺少 PD 分离局限、成本与适用边界的系统讨论 **适用场景**:初学者理解 PD 分离原理与演进脉络的入门综述;需要快速检索 PD 分离相关论文谱系的工程师。 **关联建议**:进阶阅读 DistServe(OSDI 2024)原论文及 Zoe Lee 的精读文章;实践侧阅读 akaihaoshuai 的 9 条实测结论与 vLLM/sglang 部署文档。 --- ## 配图 ![-](../../金鹏/20260806/20260806-001.png)