文档(金鹏): 2026-08-06 章节 48 篇文章摘要归档

- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇)
- 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/
- 章节重组为 9 个主题分组并挂接摘要引用
This commit is contained in:
2026-08-06 18:00:50 +08:00
parent aa585542d1
commit c0ba3fb853
111 changed files with 13271 additions and 0 deletions
+138
View File
@@ -14,6 +14,144 @@
- 360 x 276
- 540 x 414
## 2026-08-06
- [PD分离技术原理](https://zhuanlan.zhihu.com/p/27836625742)
- ![-](./金鹏/20260806/20260806-001-thumb.png)
- ![-](./金鹏/20260806/20260806-001.png)
- **Prefill 吃算力、Decode 吃带宽——两个阶段特性相反,混在一起永远无法同时最优;拆开分池、各配最优硬件与策略,才是推理引擎的架构正道。**
- 认知层: [LLM PD 分离背后的架构问题](https://zhuanlan.zhihu.com/p/27836625742)
- 摘要:[查看](../知乎专栏/极客博哥/2026-08-05_LLM_PD_分离背后的架构问题_摘要.md)
- 认知层: [大模型系列:深度解析 Prefill-Decode 分离式部署架构](https://zhuanlan.zhihu.com/p/1918334902492963669)
- 摘要:[查看](../知乎专栏/猫先生/2025-06-17_大模型系列_深度解析_Prefill-Decode_分离式部署架构_摘要.md)
- 认知层: [【推理】PD分离的绝佳入门教程——DistServe](https://zhuanlan.zhihu.com/p/19666783423)
- 摘要:[查看](../知乎专栏/Zoe Lee/2026-08-05_推理_PD分离的绝佳入门教程_DistServe_摘要.md)
- 认知层: [大模型学习 | PD分离详解](https://zhuanlan.zhihu.com/p/2001354095441757984)
- 摘要:[查看](../知乎专栏/秋月如珪/2026-02-02_大模型学习_PD分离详解_摘要.md)
- 认知层: [大模型推理 PD 分离技术:核心原理、技术优势、挑战与未来展望](https://www.eet-china.com/mp/a412848.html)
- 摘要:[查看](../电子工程专辑/2026-08-05_大模型推理PD分离技术_核心原理_技术优势_挑战与未来展望_摘要.md)
- 认知层: [【大模型】深入解析大模型推理架构之 Prefill-Decode Disaggregation](https://blog.csdn.net/Zlyzjiabjw547479/article/details/149499063)
- 摘要:[查看](../CSDN博客/烟锁池塘柳0/2025-07-21_大模型_深入解析大模型推理架构之_Prefill-Decode_Disaggregation_(PD分离)_摘要.md)
- [PD分离实测数据](https://zhuanlan.zhihu.com/p/1919794916504114120)
- ![-](./金鹏/20260806/20260806-002-thumb.png)
- ![-](./金鹏/20260806/20260806-002.png)
- **一手实测是打破宣传神话的唯一尺子——真实负载吞吐 +20%~50%、KV 传输 1.5x 优化、ITL 毛刺消除,一切收益都要以实测为准。**
- 实践层: [LLM关于PD分离的最新实测](https://zhuanlan.zhihu.com/p/1919794916504114120)
- 摘要:[查看](../知乎专栏/akaihaoshuai/2025-06-22_LLM关于PD分离的最新实测_摘要.md)
- 实践层: [下一代推理优化技术:高性能网络驱动的PD分离与KV Cache Offload测试](https://chaoqing-i.com/blog/next-gen-inference-optimization-pd-separation-kv-cache-offload-test)
- 摘要:[查看](../超擎数智/2026-08-05_下一代推理优化技术_高性能网络驱动的PD分离与KV_Cache_Offload测试_上_摘要.md)
- 实践层: [1.5x提升:PD分离KV cache传输的实践经验](https://zhuanlan.zhihu.com/p/1946608360259577576)
- 摘要:[查看](../知乎专栏/PD分离传输优化联合团队/2026-08-05_1.5x提升_PD分离KV_cache传输的实践经验_摘要.md)
- 实践层: [异构智算中心分布式PD分离推理技术的探索与实践](https://www.cww.net.cn/article?id=604206)
- 摘要:[查看](../通信世界网/2026-08-05_异构智算中心分布式PD分离推理技术的探索与实践_摘要.md)
- 实践层: [ODCC AI存储实验室KV Cache评测](https://chaoqing-i.com/blog/odcc-ai-storage-lab-kv-cache-evaluation-innogrit-n3x-ssd)
- 摘要:[查看](../超擎数智/2026-08-06_ODCC_AI存储实验室KV_Cache评测再发布_英韧N3X以硬核SSD性能筑牢AI推理引擎_摘要.md)
- [PD分离工程落地](https://docs.vllm.ai/en/latest/features/disagg_prefill/)
- ![-](./金鹏/20260806/20260806-003-thumb.png)
- ![-](./金鹏/20260806/20260806-003.png)
- **vLLM/SGLang 原生支持、官方文档给出真实参数——PD分离已从论文走进开源框架,落地要过“KV 传输、P:D 配比、平台集成”三道工程关。**
- 总纲: [vLLM 官方文档:Disaggregated Prefilling (experimental)](https://docs.vllm.ai/en/latest/features/disagg_prefill/)
- 摘要:[查看](../vLLM官方文档/2026-07-29_Disaggregated_Prefilling_experimental_vLLM_摘要.md)
- 总纲: [SGLang 官方文档:PD Disaggregation](https://docs.sglang.com.cn/advanced_features/pd_disaggregation.html)
- 摘要:[查看](../SGLang官方文档/2025-12-30_PD_分离_PD_Disaggregation_SGLang_框架_摘要.md)
- 根基层: [vLLM PD 分离(源码级机制)](https://mp.weixin.qq.com/s/p6gh4hK25PujQ1UJzFTbLg)
- 摘要:[查看](../微信公众平台/marcus/2026-08-05_vLLM_PD分离_源码级机制_marcus_摘要.md)
- 实践层: [LLM 做 PD 分离后,怎么更慢了?](https://mp.weixin.qq.com/s/0HlmtIuPGU7QE5r1fyhcsA)
- 摘要:[查看](../微信公众平台/丁师兄/2026-08-05_LLM做PD分离后怎么更慢了_丁师兄_摘要.md)
- 总纲: [PD 分离推理架构详解](https://cloud.tencent.com/developer/article/2586469)
- 摘要:[查看](../腾讯云开发者社区/cr7258/2025-09-21_PD_分离推理架构详解_摘要.md)
- 实践层: [pd分离在vllm中用法](https://blog.csdn.net/qq_44319972/article/details/155456852)
- 摘要:[查看](../CSDN博客/小徐炸酱面/2025-12-01_pd分离在vllm中用法_摘要.md)
- 生态层: [LMCache 博客](https://blog.lmcache.ai/)
- 摘要:[查看](../LMCache博客/LMCache_Team/2026-08-06_LMCache_博客文章列表_摘要.md)
- [厂商方案与产业生态](https://mp.weixin.qq.com/s/kdxJng0X3RT2UU8EnuxeSw)
- ![-](./金鹏/20260806/20260806-004-thumb.png)
- ![-](./金鹏/20260806/20260806-004.png)
- **从 UCSD 论文到黄仁勋 GTC、从昇腾专家并行到 H3C 解耦式 Serving——PD分离已被全行业拥抱,国产异构落地路径已打通。**
- 生态层: [揭秘老黄演讲关键技术 PD分离:UCSD 华人团队 DistServe](https://mp.weixin.qq.com/s/kdxJng0X3RT2UU8EnuxeSw)
- 摘要:[查看](../微信公众平台/新智元/2026-08-05_揭秘老黄演讲PD分离_UCSD华人团队DistServe_新智元_摘要.md)
- 生态层: [昇腾大规模专家并行:PD分离,让推理性能再提速30%](https://www.hiascend.com/developer/techArticles/20250423-1)
- 摘要:[查看](../昇腾社区/2025-04-23_昇腾大规模专家并行技术解码_PD分离_让推理性能再提速30%_摘要.md)
- 生态层: [基于 Prefill/Decode 分离的大规模推理 Serving 架构](https://www.h3c.com/cn/d_202604/2832717_233453_0.htm)
- 摘要:[查看](../H3C新华三官网/2026-04-27_基于_Prefill_Decode_分离的大规模推理_Serving_架构_摘要.md)
- 生态层: [LLM推理成本直降60%:PD分离在大模型商业化中的关键价值](https://developer.aliyun.com/article/1681023)
- 摘要:[查看](../阿里云开发者社区/2025-09-09_LLM推理成本直降60%_PD分离在大模型商业化中的关键价值_摘要.md)
- 生态层: [如何使用 NVIDIA Dynamo 减少 KV 缓存瓶颈](https://developer.nvidia.cn/blog/how-to-reduce-kv-cache-bottlenecks-with-nvidia-dynamo/)
- 摘要:[查看](../NVIDIA_技术博客/2025-09-18_如何使用_NVIDIA_Dynamo_减少_KV_缓存瓶颈_摘要.md)
- [开源推理平台](https://kvcache-ai.github.io/Mooncake/index.html)
- ![-](./金鹏/20260806/20260806-005-thumb.png)
- ![-](./金鹏/20260806/20260806-005.png)
- **Mooncake、NVIDIA Dynamo、llm-d、AIBrix——工业级开源平台把 PD分离 与分布式 KV Cache、智能路由、K8s 编排组合成完整推理底座。**
- 总纲: [MooncakeKVCache 中心化解耦架构)](https://kvcache-ai.github.io/Mooncake/index.html)
- 摘要:[查看](../Mooncake_项目/2026-08-06_Welcome_to_Mooncake_摘要.md)
- 生态层: [NVIDIA Dynamo(引擎无关的推理编排)](https://docs.nvidia.com/dynamo/latest/index.html)
- 摘要:[查看](../NVIDIA_Dynamo_文档/2026-08-06_Welcome_to_NVIDIA_Dynamo_摘要.md)
- 生态层: [llm-dK8s 原生分布式推理栈)](https://llm-d.ai/docs/architecture)
- 摘要:[查看](../llm-d/2026-08-06_llm-d_K8s原生分布式推理栈架构_摘要.md)
- 生态层: [AIBrix(字节跳动云原生推理)](https://github.com/vllm-project/aibrix)
- 摘要:[查看](../GitHub/字节跳动/2026-06-16_AIBrix_云原生推理_摘要.md)
- 总纲: [cr7258/ai-infra-learning · Lesson 06 PD分离(系统化课程)](https://github.com/cr7258/ai-infra-learning/tree/main/lesson/06-disaggregating-prefill-and-decoding)
- 摘要:[查看](../GitHub/cr7258/2026-08-06_Lesson_06_PD分离推理架构详解_摘要.md)
- [推理解耦学术前沿](https://arxiv.org/abs/2401.09670)
- ![-](./金鹏/20260806/20260806-006-thumb.png)
- ![-](./金鹏/20260806/20260806-006.png)
- **从 DistServe 的 Goodput 革命到 AFD 的算子级解聚——五篇论文勾勒推理解耦从“阶段分离”走向“算子分离”的演进谱系。**
- 根基层: [DistServe: Disaggregating Prefill and Decoding for Goodput-optimized LLM Serving](https://arxiv.org/abs/2401.09670)
- 摘要:[查看](../arXiv/Yinmin_Zhong/2024-01-18_DistServe_摘要.md)
- 根基层: [Splitwise: Efficient Generative LLM Inference Using Phase Splitting](https://arxiv.org/abs/2311.18677)
- 摘要:[查看](../arXiv/Pratyush_Patel/2023-11-30_Splitwise_摘要.md)
- 根基层: [TetriInfer: Inference without Interference](https://arxiv.org/abs/2401.11181)
- 摘要:[查看](../arXiv/Cunchen_Hu/2024-01-20_TetriInfer_摘要.md)
- 根基层: [Mooncake: A KVCache-centric Disaggregated Architecture](https://arxiv.org/abs/2407.00079)
- 摘要:[查看](../arXiv/Ruoyu_Qin/2024-06-24_Mooncake_摘要.md)
- 根基层: [How Far Can Disaggregation Go? Attention-FFN Disaggregation (AFD)](https://arxiv.org/abs/2605.28302)
- 摘要:[查看](../arXiv/Hanjiang_Wu/2026-05-27_AFD_How_Far_Can_Disaggregation_Go_摘要.md)
- 认知层: [当 PD 分离成为标配,推理的未来在 AFD](https://mp.weixin.qq.com/s/5YsLOl4oIfHzNdi8pbmURQ)
- 摘要:[查看](../微信公众平台/小哥人工智能笔记/2026-08-05_当PD分离成为标配_推理的未来在AFD_摘要.md)
- [网络与存储基础设施](https://quant67.com/post/llm-infra/04-interconnect/04-interconnect.html)
- ![-](./金鹏/20260806/20260806-007-thumb.png)
- ![-](./金鹏/20260806/20260806-007.png)
- **推理集群网络 200G RoCE 即可起步、KV Cache 按 HBM→DRAM→SSD 分层卸载——网络与存储是 PD分离 落地的隐形底座。**
- 根基层: [大模型基础设施工程 04:互联与网络——NVLink、InfiniBand](https://quant67.com/post/llm-infra/04-interconnect/04-interconnect.html)
- 摘要:[查看](../土法炼钢兴趣小组的算法知识备份/2026-04-22_大模型基础设施工程04_互联与网络_NVLink_InfiniBand_RoCE_与国产替代_摘要.md)
- 认知层: [InfiniBand vs 以太网 GPU 集群对比:800G 网络架构决策指南](https://introl.com/zh/blog/infiniband-vs-ethernet-gpu-clusters-800g-architecture)
- 摘要:[查看](../Introl/2026-03-27_InfiniBand_vs_以太网_GPU_集群对比_800G_网络架构决策指南_摘要.md)
- 认知层: [GTC 解读:当我们谈论 AI 推理的 KV Cache](https://www.geekpark.net/news/361648)
- 摘要:[查看](../极客公园/2026-03-25_GTC_解读_当我们谈论_AI_推理的_KV_Cache_我们在做什么_摘要.md)
- 认知层: [KV Cache 缓存可卸载至 SSD:打破内存墙限制](https://www.fxbaogao.com/detail/5116282)
- 摘要:[查看](../发现报告/国泰海通证券/2025-10-28_KV_Cache_缓存可卸载至_SSD_打破内存墙限制_AI_SSD迎来广阔成长空间_摘要.md)
- 生态层: [Tair KVCache - 动态分级缓存(阿里云)](https://www.aliyun.com/product/kvcache)
- 摘要:[查看](../阿里云/2025-09-23_Tair_KVCache_动态分级缓存_LLM推理缓存_数据库_阿里云_摘要.md)
- [Token经济与算力经营](https://introl.com/zh/blog/inference-unit-economics-true-cost-per-million-tokens-guide)
- ![-](./金鹏/20260806/20260806-008-thumb.png)
- ![-](./金鹏/20260806/20260806-008.png)
- **每百万 token 成本三年从 20 美元降到 0.4 美元,算力资产正从“卖卡”走向“Token 工厂”经营——PD分离 是降本侧的工序。**
- 根基层: [推理单位经济学:每百万 Token 的真实成本](https://introl.com/zh/blog/inference-unit-economics-true-cost-per-million-tokens-guide)
- 摘要:[查看](../Introl/2026-02-09_推理单位经济学_每百万Token的真实成本_摘要.md)
- 战略层: [底座算力跃迁到 token 工厂的新机会](https://www.fxbaogao.com/detail/5481471)
- 摘要:[查看](../中邮证券/孙业亮_刘聪颖/2026-06-16_中邮证券_底座算力跃迁到token工厂的新机会_摘要.md)
- 总纲: [大模型推理优化关键技术与应用实践研究报告(中国信通院)](https://www.caict.ac.cn/kxyj/qwfb/ztbg/202604/P020260415615308750699.pdf)
- 摘要:[查看](../中国信通院/中国信息通信研究院人工智能研究所/2026-03-31_大模型推理优化关键技术与应用实践研究报告_2026年_摘要.md)
- [AI组织与宏观](https://mp.weixin.qq.com/s/AgMLIqbA6PeGW7phFJAvOg)
- ![-](./金鹏/20260806/20260806-009-thumb.png)
- ![-](./金鹏/20260806/20260806-009.png)
- **AI 浪潮之上:组织如何从分散提效走向 AI Native,美国政治反弹如何改写扩张模式——宏观变量决定技术落地的节奏。**
- 实践层: [从分散提效到 AI Native 组织的实践](https://mp.weixin.qq.com/s/AgMLIqbA6PeGW7phFJAvOg)
- 摘要:[查看](../微信公众平台/数字人BuilderAgent团队/2026-08-06_从分散提效到_AI_Native_组织的实践_摘要.md)
- 战略层: [美国镜鉴:当AI浪潮遭遇政治反弹](https://mp.weixin.qq.com/s/OLxrS_jzJqz0z6bKIJMsfA)
- 摘要:[查看](../微信公众平台/CF40研究部/2026-07-28_美国镜鉴_当AI浪潮遭遇政治反弹_摘要.md)
- 生态层: [刚刚!谷歌突发最炸离职](https://mp.weixin.qq.com/s/5RcNh03rxFZMbJZKoKQvLw)
- 摘要:[查看](../微信公众平台/深科技首席/2026-08-06_刚刚_谷歌突发最炸离职_摘要.md)
> **说明**:PD分离 主题下 45 条链接 + 3 条独立链接共 48 条全部完成摘要归档;今日头条转载版与 CSDN cr7258 版同源于《PD 分离推理架构详解》,复用其摘要。配图按主题分组生成(大图 2560×1440 + 列表标题图 160×90)。
## 2026-07-31
- [企业AI落地](https://mp.weixin.qq.com/s/wD0aOLCrt3fbjaiGCCTEPQ)