文档(金鹏): 2026-08-06 章节 48 篇文章摘要归档

- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇)
- 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/
- 章节重组为 9 个主题分组并挂接摘要引用
This commit is contained in:
2026-08-06 18:00:50 +08:00
parent aa585542d1
commit c0ba3fb853
111 changed files with 13271 additions and 0 deletions
@@ -0,0 +1,41 @@
# 1.5x提升:PD分离KV cache传输的实践经验
> **来源**:知乎专栏「LLM推理基础与框架」
> **作者**:PD分离传输优化 HW/YN 联合团队(ky、zzy、LCAIZJ、CZ、hyh、lrj、zpb、dfq、fjw 等)
> **发布日期**2026-08-05
> **原文链接**https://zhuanlan.zhihu.com/p/1946608360259577576
---
## 目录
最近我们团队[1]在 vLLM 上开发了一种 KV cache 传输的 connector,实现了传输性能 __50%__[2]__的提升__,相关代码已全部开源。在过程中遇到的挑战/问题在这里进行一个分享,希望能给从事相关行业的读者带来些思考与借鉴。
基础知识参看上一篇:
## 1 问题模型分析
__总体需求__:LLM 的推理 PD 分离场景下,Prefill 实例要将计算好的 KV cache 传输给 Decode 实例进行后续运算,需要设计一种高效的传输机制保证推理性能。
![Image 1](https://picx.zhimg.com/v2-7b42f2c816805d898b3ba1dda04441f5_1440w.jpg)
KV cache 传输属于分布式模型数据传输的一种,所以网络传输中存在的带宽、时延、可靠性等问题都会遇到。KV cache 传输有自身特点,关注侧重点也有差异,主要看其对性能指标(TTFT/TPOT)的影响。如下大致梳理了 KV cache 传输中会遇到的问题:
| 类型 | 问题 | 举例 |
| --- | --- | --- |
| 数据 | 数据的类型 | torch.tensor、GPU/CPU tensor |
| | 内存排布形态 | 按层排布、凑整排布 |
| | attention 模块类型 | GQA/MLA/MHA |
| 数据传输 | 传输通道 | TCP/RDMA |
| | 链路数量 | FullMesh、异构传输; |
| | 网络形态 | 跨节点、跨交换机,异构硬件 |
| | 传输效率 | 及 |
## 参考
1. ^PD 分离传输优化 HW/YN 联合团队:ky、zzy、LCAIZJ、CZ、hyh、lrj、zpb、dfq、fjw 等
2. ^性能参考基线为起始版本,平均提升基线为 0.5x,某些情况下可能会有一定损失
---
> **下载说明**:本文原文托管于知乎专栏,受知乎反爬虫/登录限制,本次抓取仅获得文章开头部分(目录、引言、问题模型分析小节及参考文献),正文后续章节(传输方案设计、优化手段、benchmark 数据等)未能完整获取。如需完整内容请访问原文链接登录阅读。