# 1.5x提升:PD分离KV cache传输的实践经验 > **来源**:知乎专栏「LLM推理基础与框架」 > **作者**:PD分离传输优化 HW/YN 联合团队(ky、zzy、LCAIZJ、CZ、hyh、lrj、zpb、dfq、fjw 等) > **发布日期**:2026-08-05 > **原文链接**:https://zhuanlan.zhihu.com/p/1946608360259577576 --- ## 目录 最近我们团队[1]在 vLLM 上开发了一种 KV cache 传输的 connector,实现了传输性能 __50%__[2]__的提升__,相关代码已全部开源。在过程中遇到的挑战/问题在这里进行一个分享,希望能给从事相关行业的读者带来些思考与借鉴。 基础知识参看上一篇: ## 1 问题模型分析 __总体需求__:LLM 的推理 PD 分离场景下,Prefill 实例要将计算好的 KV cache 传输给 Decode 实例进行后续运算,需要设计一种高效的传输机制保证推理性能。 ![Image 1](https://picx.zhimg.com/v2-7b42f2c816805d898b3ba1dda04441f5_1440w.jpg) KV cache 传输属于分布式模型数据传输的一种,所以网络传输中存在的带宽、时延、可靠性等问题都会遇到。KV cache 传输有自身特点,关注侧重点也有差异,主要看其对性能指标(TTFT/TPOT)的影响。如下大致梳理了 KV cache 传输中会遇到的问题: | 类型 | 问题 | 举例 | | --- | --- | --- | | 数据 | 数据的类型 | torch.tensor、GPU/CPU tensor | | | 内存排布形态 | 按层排布、凑整排布 | | | attention 模块类型 | GQA/MLA/MHA | | 数据传输 | 传输通道 | TCP/RDMA | | | 链路数量 | FullMesh、异构传输; | | | 网络形态 | 跨节点、跨交换机,异构硬件 | | | 传输效率 | 及 | ## 参考 1. ^PD 分离传输优化 HW/YN 联合团队:ky、zzy、LCAIZJ、CZ、hyh、lrj、zpb、dfq、fjw 等 2. ^性能参考基线为起始版本,平均提升基线为 0.5x,某些情况下可能会有一定损失 --- > **下载说明**:本文原文托管于知乎专栏,受知乎反爬虫/登录限制,本次抓取仅获得文章开头部分(目录、引言、问题模型分析小节及参考文献),正文后续章节(传输方案设计、优化手段、benchmark 数据等)未能完整获取。如需完整内容请访问原文链接登录阅读。