diff --git a/知识/金鹏.md b/知识/金鹏.md index 60fc30c..57fc0f8 100644 --- a/知识/金鹏.md +++ b/知识/金鹏.md @@ -21,137 +21,384 @@ - ![-](./金鹏/20260806/20260806-001.png) - **Prefill 吃算力、Decode 吃带宽——两个阶段特性相反,混在一起永远无法同时最优;拆开分池、各配最优硬件与策略,才是推理引擎的架构正道。** - 认知层: [LLM PD 分离背后的架构问题](https://zhuanlan.zhihu.com/p/27836625742) - - 摘要:[查看](../知乎专栏/极客博哥/2026-08-05_LLM_PD_分离背后的架构问题_摘要.md) + - 摘要:[查看](./知乎专栏/极客博哥/2026-08-05_LLM_PD_分离背后的架构问题_摘要.md) + - 极客博哥(solrex) / 知乎专栏 + - **PD 直连 vs KV Cache Store 是首要抉择**——直连延迟低但锁定 P/D 节点关系;中间存储多一次传输但容错更好、可兼做 Prefix Caching(Mooncake、vLLM、RTP-LLM 均选后者) + - **首 token 两条计算路径**——算到 hidden states 免加载 lm_head(vLLM 采用)vs 算到 token id 传输量小、解码端简单(RTP-LLM 采用) + - **KV Cache Store 设计远超传统 KV 存储**——VRAM/DRAM/NVMe 介质、TCP/NVLink/RDMA 协议、分 layer/page 写入与链式 prefix 引用,目前无开源完整方案 + - **核心洞见:主流资料讲 PD 分离收益,本文聚焦"实现前的六大决策空间"——按层传输、角色互换、存储选型均无理想方案,未来可能是按场景参数化的灵活配置** - 认知层: [大模型系列:深度解析 Prefill-Decode 分离式部署架构](https://zhuanlan.zhihu.com/p/1918334902492963669) - - 摘要:[查看](../知乎专栏/猫先生/2025-06-17_大模型系列_深度解析_Prefill-Decode_分离式部署架构_摘要.md) + - 摘要:[查看](./知乎专栏/猫先生/2025-06-17_大模型系列_深度解析_Prefill-Decode_分离式部署架构_摘要.md) + - 猫先生 / 知乎专栏 + - **两阶段资源特性根本不同**——Prefill 高并行、矩阵乘法为主、计算密集;Decode 逐 token 串行、频繁访问 KV Cache、内存带宽密集,这是 PD 分离的立论基础 + - **论文谱系六连**——SARATHI(分块预填充)→ DistServe(PD 解耦)→ LoongServe(弹性序列并行)→ Mooncake(KVCache 中心化)→ Speculative Prefill(TTFT 加速)→ LServe(混合稀疏注意力) + - **通信底座 NCCL 与 NIXL**——NCCL 适合单机/高带宽集群内 GPU-GPU 通信;NIXL 是面向推理系统的"远程 NCCL"扩展层,专为跨节点 KV Cache 远程传输设计 + - **vLLM 三组件架构**——Proxy 路由,prefill 实例只生成 KV Cache,decode 实例经 drop_select 获取 KV 后跳过 prefill 直接生成 token + - **核心洞见:Prefill 与 Decode 不仅在结构上不同,性能瓶颈也大相径庭——KV Cache 复用使 Decode 的 attention 复杂度降低一个量级,实现"以存换算"** - 认知层: [【推理】PD分离的绝佳入门教程——DistServe](https://zhuanlan.zhihu.com/p/19666783423) - - 摘要:[查看](../知乎专栏/Zoe Lee/2026-08-05_推理_PD分离的绝佳入门教程_DistServe_摘要.md) + - 摘要:[查看](./知乎专栏/Zoe Lee/2026-08-05_推理_PD分离的绝佳入门教程_DistServe_摘要.md) + - Zoe Lee / 知乎专栏 + - **动机有实验证据**——混合 batch 中新增一个 prefill 请求会给 decoding 批处理带来显著延迟危害 + - **M/D/1 排队模型推导**——到达率低时 TP 更优、到达率高时 PP 更优;Decode 侧过大的 TP 会引入过量通信使延迟优势消失 + - **SLO 驱动的寻优算法**——对 P/D 分别拟合延迟模型,筛选满足 TTFT/TPOT 双 SLO 且支撑到达率达标、GPU 数最少的方案 + - **核心洞见:作者亲自复现后报告了与论文结论的张力——给定 P/D 卡数下并行策略的影响似乎不大,方法论须经实践检验** - 认知层: [大模型学习 | PD分离详解](https://zhuanlan.zhihu.com/p/2001354095441757984) - - 摘要:[查看](../知乎专栏/秋月如珪/2026-02-02_大模型学习_PD分离详解_摘要.md) + - 摘要:[查看](./知乎专栏/秋月如珪/2026-02-02_大模型学习_PD分离详解_摘要.md) + - 秋月如珪 / 知乎专栏 + - **Goodput 由双 SLO 的较紧者决定**——A100/13B 下 TTFT 约束约 3 RPS、TPOT 约束仅约 1.6 RPS;2P1D 配置可将 Goodput 提升至 3.3 RPS/GPU(约 2 倍) + - **KV Cache 传输三级粒度**——请求级实现简单但大 prompt 延迟高;层级可重叠计算(Splitwise);块级保持计算饱和但复杂度高(TetriInfer) + - **独立 batching 与差异化并行**——Prefill 保持小 batch(1-4)避免 TTFT 线性增加,Decode 用大 batch(64-128);Prefill 用张量并行、Decode 用流水线/数据并行 + - **四大工业实践**——Dynamo、vLLM V1、llm-d、Mooncake(长上下文吞吐最高提升 525%) + - **核心洞见:PD 分离代表推理架构从统一处理向阶段特化演进——但延迟要求不极端的场景,Chunked-Prefills 是更简单的折中** - 认知层: [大模型推理 PD 分离技术:核心原理、技术优势、挑战与未来展望](https://www.eet-china.com/mp/a412848.html) - - 摘要:[查看](../电子工程专辑/2026-08-05_大模型推理PD分离技术_核心原理_技术优势_挑战与未来展望_摘要.md) + - 摘要:[查看](./电子工程专辑/2026-08-05_大模型推理PD分离技术_核心原理_技术优势_挑战与未来展望_摘要.md) + - 电子工程专辑 + - **悬殊的实测对比**——255 token 输入下 prefill 仅 0.24s、decode 达 32.9s,慢约 137 倍、占整体推理时间 99% + - **共置干扰有据可查**——混合批处理下 decode 的 P99 延迟可能增加 78% 以上,被迫过度配置资源推高成本 + - **五大工程挑战框架**——资源动态分配、内存管理(分层存储/RDMA)、延迟平衡(优先级调度/流水线重叠)、分布式通信、框架与异构硬件适配 + - **百度智能云实践**——低时延 HPN 集群(4μs 端到端)+ RDMA KV 传输 + 分队列调度,整体吞吐提升 20% + - **核心洞见:decode 阶段 GPU 算力利用率仅约 1%——两阶段分离部署、分别优化,才能提升吞吐并降低 TTFT/TPOT** - 认知层: [【大模型】深入解析大模型推理架构之 Prefill-Decode Disaggregation](https://blog.csdn.net/Zlyzjiabjw547479/article/details/149499063) - - 摘要:[查看](../CSDN博客/烟锁池塘柳0/2025-07-21_大模型_深入解析大模型推理架构之_Prefill-Decode_Disaggregation_(PD分离)_摘要.md) + - 摘要:[查看](./CSDN博客/烟锁池塘柳0/2025-07-21_大模型_深入解析大模型推理架构之_Prefill-Decode_Disaggregation_(PD分离)_摘要.md) + - 烟锁池塘柳0 / CSDN 博客 + - **异构硬件匹配**——Prefill 集群用少量顶级算力卡(H100/H200 类)、Decode 集群用大量高带宽性价比卡(A100 类),避免昂贵计算单元"无所事事" + - **五步工作流**——请求调度→prefill 执行→KV Cache 迁移(核心步骤,可能高达数 GB)→decode 执行→结束释放 + - **三大挑战与对策**——KV 传输开销(RDMA/量化/位置亲和调度)、复杂调度(全局状态感知)、资源孤岛(动态角色切换/负载预测) + - **核心洞见:PD 分离体现计算体系结构的经典思想——用专门化的组件处理专门化的任务,是推理系统从"作坊式"走向"工业化"的重要一步** - [PD分离实测数据](https://zhuanlan.zhihu.com/p/1919794916504114120) - ![-](./金鹏/20260806/20260806-002-thumb.png) - ![-](./金鹏/20260806/20260806-002.png) - **一手实测是打破宣传神话的唯一尺子——真实负载吞吐 +20%~50%、KV 传输 1.5x 优化、ITL 毛刺消除,一切收益都要以实测为准。** - 实践层: [LLM关于PD分离的最新实测](https://zhuanlan.zhihu.com/p/1919794916504114120) - - 摘要:[查看](../知乎专栏/akaihaoshuai/2025-06-22_LLM关于PD分离的最新实测_摘要.md) + - 摘要:[查看](./知乎专栏/akaihaoshuai/2025-06-22_LLM关于PD分离的最新实测_摘要.md) + - akaihaoshuai / 知乎专栏 + - **收益有明确阈值**——至少输入>8k、输出>100、并发>10、模型>32B 才有效果;吞吐提升 20%~50%,且优化的是 TBT 而非 TTFT + - **P/D 配比反直觉**——2P2D 一般不行;因 prefill 只执行一次而 decode 要很多遍,1P2D 更能提升整体资源利用率 + - **传输方式决定 TTFT 损耗**——GPU 传输(NCCL)基本保持原 TTFT,CPU/disk 传输都会变慢;NCCL 固定全部 GPU、不适合动态扩缩容 + - **异构框架最大化性价比**——4090 算力约为 A/H 系列 30%~50% 但带宽不足 10%,非常适合 prefill 阶段 + - **核心洞见:PD 分离的核心其实在于 cache 的调度——能单卡跑的没必要多卡,能单机承载的没必要多机** - 实践层: [下一代推理优化技术:高性能网络驱动的PD分离与KV Cache Offload测试](https://chaoqing-i.com/blog/next-gen-inference-optimization-pd-separation-kv-cache-offload-test) - - 摘要:[查看](../超擎数智/2026-08-05_下一代推理优化技术_高性能网络驱动的PD分离与KV_Cache_Offload测试_上_摘要.md) + - 摘要:[查看](./超擎数智/2026-08-05_下一代推理优化技术_高性能网络驱动的PD分离与KV_Cache_Offload测试_上_摘要.md) + - 超擎数智 / 官网博客(NVIDIA、联想、DaoCloud、纳多德联合) + - **跨厂商联合测试模板**——1 台 H20(Prefill)+ 3 台 L20(Decode)+ 3 台 NVMe 分布式存储 + 400G/200G RoCE 组网,对照组/实验组对比设计 + - **预期收益量化**——Decode 延迟降 30%-50%、H20 利用率 60%→85%、显存占用减 60%、上下文 2K→16K、QPS 提升 2 倍且功耗降 20% + - **代价清单**——PD 分离与 KV Offload 引入通信开销、调度复杂度、实现复杂、内存占用四类代价 + - **核心洞见:本文提供可复用的测试设计模板,但预期数字未经实测验证——收益需以下篇实测为准,网络是 PD 分离兑现收益的隐性前提** - 实践层: [1.5x提升:PD分离KV cache传输的实践经验](https://zhuanlan.zhihu.com/p/1946608360259577576) - - 摘要:[查看](../知乎专栏/PD分离传输优化联合团队/2026-08-05_1.5x提升_PD分离KV_cache传输的实践经验_摘要.md) + - 摘要:[查看](./知乎专栏/PD分离传输优化联合团队/2026-08-05_1.5x提升_PD分离KV_cache传输的实践经验_摘要.md) + - PD分离传输优化联合团队(HW/YN) / 知乎专栏 + - **传输性能提升 50%**——在 vLLM 上开发的 KV cache 传输 connector 相比起始版本平均提升 0.5x,相关代码已全部开源 + - **两维问题分类框架**——从"数据"(张量类型/内存排布/attention 模块)与"数据传输"(通道/链路/网络形态/效率)系统归类影响 TTFT/TPOT 的传输问题 + - **核心洞见:KV cache 传输的取舍应围绕其对 TTFT/TPOT 的影响展开——这份分类清单是排查传输瓶颈的可复用起点,传输层组件正从各家私研走向社区共建** - 实践层: [异构智算中心分布式PD分离推理技术的探索与实践](https://www.cww.net.cn/article?id=604206) - - 摘要:[查看](../通信世界网/2026-08-05_异构智算中心分布式PD分离推理技术的探索与实践_摘要.md) + - 摘要:[查看](./通信世界网/2026-08-05_异构智算中心分布式PD分离推理技术的探索与实践_摘要.md) + - 通信世界网(中国电信广域验证试验) + - **三大核心挑战**——海量 KV Cache 跨中心传输(网络不足可"抵消 PD 分离带来的效率收益")、跨中心资源调度(易形成资源"孤岛")、异构适配(英伟达与昇腾集合通信库互不兼容) + - **OTN 广域试验量化边界**——基于英伟达+沐曦异构 GPU、DeepSeek-R1 蒸馏模型,800km 拉远、64:1 收敛比下性能可达本地同场景 99%,网络劣化时性能下降控制在 1%-5% + - **核心洞见:无损网络下异构存量算力可跨中心协同推理,为"以存量替代新建"的算力供给思路提供实证支撑——但网络性能不足将抵消 PD 分离全部收益** - 实践层: [ODCC AI存储实验室KV Cache评测](https://chaoqing-i.com/blog/odcc-ai-storage-lab-kv-cache-evaluation-innogrit-n3x-ssd) - - 摘要:[查看](../超擎数智/2026-08-06_ODCC_AI存储实验室KV_Cache评测再发布_英韧N3X以硬核SSD性能筑牢AI推理引擎_摘要.md) + - 摘要:[查看](./超擎数智/2026-08-06_ODCC_AI存储实验室KV_Cache评测再发布_英韧N3X以硬核SSD性能筑牢AI推理引擎_摘要.md) + - 超擎数智 / 官网博客(ODCC AI 存储实验室 + 焱融 YRCache + 英韧科技) + - **KV Cache 负载特征倒逼存储选型**——高并发、高随机、小 I/O,叠加预加载/长上下文要求高顺序带宽,四维指标(顺序带宽/随机 IOPS/稳态输出/尾延迟)决定卸载收益 + - **单盘性能实证**——N3X 顺序读 14GB/s、4K 随机读近 3500K IOPS、P99 延迟低至 66μs 且全盘稳态持续输出 + - **系统级收益放大**——≥10K Token 场景首 Token 延迟从秒级降至毫秒级;中端 GPU 吞吐提升约 20 倍,长上下文下中端卡可接近高端卡效能 + - **核心洞见:"以存强算"——推理性能提升不再只能靠堆高端 GPU,存储系统优化可释放中端算力潜能(数据出自利益相关方实验室,需批判看待)** - [PD分离工程落地](https://docs.vllm.ai/en/latest/features/disagg_prefill/) - ![-](./金鹏/20260806/20260806-003-thumb.png) - ![-](./金鹏/20260806/20260806-003.png) - **vLLM/SGLang 原生支持、官方文档给出真实参数——PD分离已从论文走进开源框架,落地要过“KV 传输、P:D 配比、平台集成”三道工程关。** - 总纲: [vLLM 官方文档:Disaggregated Prefilling (experimental)](https://docs.vllm.ai/en/latest/features/disagg_prefill/) - - 摘要:[查看](../vLLM官方文档/2026-07-29_Disaggregated_Prefilling_experimental_vLLM_摘要.md) + - 摘要:[查看](./vLLM官方文档/2026-07-29_Disaggregated_Prefilling_experimental_vLLM_摘要.md) + - vLLM / 官方文档 + - **分离的两大动机**——独立调优 TTFT 与 ITL(P/D 可配不同并行策略);控制尾部 ITL(chunked prefill 也能达到但 chunk size 难以调准) + - **官方明确边界**——"Disaggregated prefill DOES NOT improve throughput",收益在延迟控制与资源分配灵活性,避免用户误用 + - **9 种 KV 传输连接器**——Nixl/Mooncake/FlexKV/LMCache/Offloading 等覆盖多条技术路线;三大核心抽象:Connector(KV 检索)、LookupBuffer(SQL 式 insert/drop_select)、Pipe(单向 FIFO 张量管道) + - **核心洞见:decode 复用 prefill token ids、跳过模板化与 tokenization——生产级实现依赖第三方贡献,vLLM 会积极合入 PR** - 总纲: [SGLang 官方文档:PD Disaggregation](https://docs.sglang.com.cn/advanced_features/pd_disaggregation.html) - - 摘要:[查看](../SGLang官方文档/2025-12-30_PD_分离_PD_Disaggregation_SGLang_框架_摘要.md) + - 摘要:[查看](./SGLang官方文档/2025-12-30_PD_分离_PD_Disaggregation_SGLang_框架_摘要.md) + - SGLang / 官方文档 + - **混排调度的两大痛点**——Prefill 中断(新批次打断正在进行的 decode)与 DP Attention 负载失衡,PD 分离逐一化解 + - **三种传输后端**——Mooncake、NIXL、昇腾(ASCEND)覆盖英伟达与国产硬件生态,DeepSeek 多节点示例展示 TP16×DP8 真实规模配置 + - **Router 是规模化前提**——独立 router 组件在 prefill/decode 实例间分配请求,实现负载均衡与容错 + - **核心洞见:配置即显式权衡——放宽 bootstrap/waiting 超时意味着接受更大平均 TTFT,但 decode 节点断连时内存清理更慢;NVLink 传输专为 NVL72 部署建议** - 根基层: [vLLM PD 分离(源码级机制)](https://mp.weixin.qq.com/s/p6gh4hK25PujQ1UJzFTbLg) - - 摘要:[查看](../微信公众平台/marcus/2026-08-05_vLLM_PD分离_源码级机制_marcus_摘要.md) + - 摘要:[查看](./微信公众平台/marcus/2026-08-05_vLLM_PD分离_源码级机制_marcus_摘要.md) + - marcus / 微信公众平台 + - **Proxy 双发请求**——同一 prompt 同时发给 P 和 D,靠 kv_transfer_params 标志区分角色(P 侧 max_tokens=1 fire-and-forget,D 侧流式等待) + - **transfer_id 关联机制**——Proxy 生成 UUID 同时发给两端,是 P/D 匹配同一请求的唯一纽带 + - **D 侧调度暂停态**——WAITING_FOR_REMOTE_KVS 状态下请求不占 GPU 计算资源,并跳过 zeroing 避免与异步写入竞态 + - **RDMA 直写远端显存**——P 侧经 batch_transfer_sync_write 直接写入 D 的 GPU 内存,D 侧零计算加载;传输完成后故意少算 1 个 token 本地重算生成首个输出 token + - **核心洞见:全文只讲"如何实现"不讲"收益几何"——P:D 配比、传输延迟、SLO 达成需与性能类文章互补阅读** - 实践层: [LLM 做 PD 分离后,怎么更慢了?](https://mp.weixin.qq.com/s/0HlmtIuPGU7QE5r1fyhcsA) - - 摘要:[查看](../微信公众平台/丁师兄/2026-08-05_LLM做PD分离后怎么更慢了_丁师兄_摘要.md) + - 摘要:[查看](./微信公众平台/丁师兄/2026-08-05_LLM做PD分离后怎么更慢了_丁师兄_摘要.md) + - 丁师兄 / 微信公众平台 + - **KV Cache 传输是最大坑**——Llama-3.1-70B 单请求 KV 约 1.34GB,10GbE 传 1 秒以上;只有 InfiniBand/NVLink 级互联才能压到几十毫秒 + - **P:D 比例无万能配置**——短 prompt 长输出需 1P3D、长上下文需 3P1D;真实流量动态变化,静态配置必出现一边闲置一边排队 + - **瓶颈切换是突变而非平滑**——workload 从 Decode 密集切到 Prefill 密集时性能可能断崖式下跌,动态配比又依赖实时监控,形成循环依赖 + - **核心洞见:"如果传输开销超过了分离带来的性能收益,整个架构就白搭了"——本批文章唯一完整的"反面清单",与红利派观点强互补** - 总纲: [PD 分离推理架构详解](https://cloud.tencent.com/developer/article/2586469) - - 摘要:[查看](../腾讯云开发者社区/cr7258/2025-09-21_PD_分离推理架构详解_摘要.md) + - 摘要:[查看](./腾讯云开发者社区/cr7258/2025-09-21_PD_分离推理架构详解_摘要.md) + - cr7258 / 腾讯云开发者社区 + - **Goodput 优于 Throughput**——只有满足 TTFT/TPOT SLO 的请求才算有效产出,高吞吐但低 Goodput 的系统用户体验依然糟糕 + - **共置干扰有量化证据**——prompt 长 128 时 decode 延迟增约 1.8 倍、长 1024 时达 12.6 倍;同时满足双 SLO 需资源过度配置 + - **分离即收益**——2P1D 配置 Goodput 约 3.3 rps/GPU,相比共置 1.6 rps/GPU 提升约 2 倍,且未引入任何并行优化 + - **工业界已规模验证**——Mooncake 模拟场景吞吐最高提升 525%、Kimi 真实负载多处理 75% 请求;vLLM 五种 KV Connector 成事实标准抽象 + - **核心洞见:当应用必须同时遵守 TTFT 与 TPOT(而非二者可权衡)时,PD 分离优于 chunked-prefills——后者动态分割无法完全解耦** - 实践层: [pd分离在vllm中用法](https://blog.csdn.net/qq_44319972/article/details/155456852) - - 摘要:[查看](../CSDN博客/小徐炸酱面/2025-12-01_pd分离在vllm中用法_摘要.md) + - 摘要:[查看](./CSDN博客/小徐炸酱面/2025-12-01_pd分离在vllm中用法_摘要.md) + - 小徐炸酱面 / CSDN 博客 + - **核心即 KV 流转**——"prefill 生成的 KV,如何让 decode 能够用起来",抽象为 KV Connector/RPC 通道 + 状态约定 + - **P/D 角色差异**——P 节点看重算力/GPU FLOPs;D 节点看重显存/网络带宽,关注 tail latency(TPOT、e2e) + - **并行策略必须匹配**——有 DP/TP 时 P/D 两侧并行策略须一致,否则出现 KV 维度不一致、block id 对不上等问题 + - **xPyD 规模公式**——总 GPU 数 = (P+D)×TP×DP,每个 P/D 节点都须能独立加载完整模型 + - **核心洞见:kv-transfer-config 参数逐项详解(kv_role/kv_rank/kv_parallel_size/kv_buffer_size)——P/D 两侧并行策略一致是实操第一原则** - 生态层: [LMCache 博客](https://blog.lmcache.ai/) - - 摘要:[查看](../LMCache博客/LMCache_Team/2026-08-06_LMCache_博客文章列表_摘要.md) + - 摘要:[查看](./LMCache博客/LMCache_Team/2026-08-06_LMCache_博客文章列表_摘要.md) + - LMCache Team / 官网博客 + - **NVIDIA Dynamo 集成 LMCache**——成为 Dynamo 的 KV 缓存层解决方案,进入数据中心级推理平台生态 + - **5000 GitHub stars 里程碑**——被解读为"KV cache 技术已成为 LLM 推理栈一等公民"的信号 + - **生态扩展方向**——GKE 分层存储(与 Google 合作)、插件框架、外部后端扩展机制,构成 KV 缓存从单机到云原生的路径 + - **核心洞见:索引页本身无实质内容,但透露的生态信号有索引价值——KV 缓存层已进入主流推理平台的标准栈** - [厂商方案与产业生态](https://mp.weixin.qq.com/s/kdxJng0X3RT2UU8EnuxeSw) - ![-](./金鹏/20260806/20260806-004-thumb.png) - ![-](./金鹏/20260806/20260806-004.png) - **从 UCSD 论文到黄仁勋 GTC、从昇腾专家并行到 H3C 解耦式 Serving——PD分离已被全行业拥抱,国产异构落地路径已打通。** - 生态层: [揭秘老黄演讲关键技术 PD分离:UCSD 华人团队 DistServe](https://mp.weixin.qq.com/s/kdxJng0X3RT2UU8EnuxeSw) - - 摘要:[查看](../微信公众平台/新智元/2026-08-05_揭秘老黄演讲PD分离_UCSD华人团队DistServe_新智元_摘要.md) + - 摘要:[查看](./微信公众平台/新智元/2026-08-05_揭秘老黄演讲PD分离_UCSD华人团队DistServe_新智元_摘要.md) + - 新智元 / 微信公众平台(UCSD Hao AI Lab) + - **goodput 概念**——有效吞吐量衡量"每秒符合 SLO 的请求数",高吞吐系统可能有效吞吐量很低(10 rps 中仅 3 个符合 SLO) + - **2P1D 量化实验**——单 A100 上 13B 模型共同处理仅 1.6 rps/GPU,分离后 2P1D 达 3.3 rps/GPU,无并行化即 2 倍提升 + - **KV 传输开销可隐藏**——OPT-175B 经 8 通道 PCIe 5.0 传输 KV 仅 17.6ms,小于单解码步 30-50ms + - **三类负载数据**——聊天 2.0-3.41 倍、代码补全 3.2 倍、摘要 4.48 倍有效吞吐量提升 + - **核心洞见:"现在,PD 分离已经成为兵家必争之地"——本批文章的理论源头与最常引用的数据出处(数据来自 A100 时代论文原型,与生产落地视角存在张力)** - 生态层: [昇腾大规模专家并行:PD分离,让推理性能再提速30%](https://www.hiascend.com/developer/techArticles/20250423-1) - - 摘要:[查看](../昇腾社区/2025-04-23_昇腾大规模专家并行技术解码_PD分离_让推理性能再提速30%_摘要.md) + - 摘要:[查看](./昇腾社区/2025-04-23_昇腾大规模专家并行技术解码_PD分离_让推理性能再提速30%_摘要.md) + - 昇腾社区 / 官方技术稿 + - **大规模专家并行三收益**——每卡只加载部分专家权重(加载更快)、单卡专家少空闲显存多(并行路数更多)、专家充分利用单卡资源(利用率更高),单卡吞吐提升 3 倍以上 + - **混合部署三痛点**——PD 时延互相干扰(保证时延<100ms 须牺牲并发)、计算与访存冲突、算力显存过配置导致利用不足 + - **PD 分离三收益**——消除阶段间时延干扰(decode 可用更大 BatchSize)、PD 配比独立调节、P/D 使用不同硬件资源 + - **核心洞见:"EP + PD 分离"组合在国产 NPU 生态(k8s + MindIE 2.0 + 魔乐社区 DeepSeek-R1 INT8)可直接照做——但性能数字无测试条件与基线说明,宣传性质明显** - 生态层: [基于 Prefill/Decode 分离的大规模推理 Serving 架构](https://www.h3c.com/cn/d_202604/2832717_233453_0.htm) - - 摘要:[查看](../H3C新华三官网/2026-04-27_基于_Prefill_Decode_分离的大规模推理_Serving_架构_摘要.md) + - 摘要:[查看](./H3C新华三官网/2026-04-27_基于_Prefill_Decode_分离的大规模推理_Serving_架构_摘要.md) + - H3C 新华三 / 官网 + - **双实例池 + KV 感知智能路由**——调度器维护全局 KV Cache 分布表,在"缓存亲和性"与"负载均衡"之间寻优,避免热点节点过载 + - **前缀缓存与多级卸载**——Radix Attention 复用公共前缀降低 TTFT;KV 卸载至 Host RAM/SSD 并预取,单卡并发容量提升数倍 + - **EPLB 专家负载均衡**——滑动窗口热度监测 + 动态复制热点专家 + 通信感知全局规约,消除"最慢 GPU 拖累 TPOT" + - **动态自适应调度**——实例按流量伸缩,闲置 P 实例可转 D 实例(反之亦然),智能调整 PD 配比 + - **核心洞见:"现代 Serving 架构不仅是静态的执行引擎,更是动态的调节系统"——PD 分离 × 专家并行的完整架构清单,其中 EPLB 与角色转换是同类文章少见的机制** - 生态层: [LLM推理成本直降60%:PD分离在大模型商业化中的关键价值](https://developer.aliyun.com/article/1681023) - - 摘要:[查看](../阿里云开发者社区/2025-09-09_LLM推理成本直降60%_PD分离在大模型商业化中的关键价值_摘要.md) + - 摘要:[查看](./阿里云开发者社区/2025-09-09_LLM推理成本直降60%_PD分离在大模型商业化中的关键价值_摘要.md) + - 阿里云开发者社区 + - **五大设计问题清单**——PD 配比与数量、请求调度、KV 存储设计、Cache 复用、可靠性——是可迁移的工程检查单 + - **四方案路线对比**——vLLM Connector-Base(简洁易用,适合 1P1D 快速部署)、Dynamo(分层架构支持大规模集群)、Mooncake(专注高性能 KV 存储传输)、SGLang(事件循环队列提升灵活性) + - **vLLM KV Transfer 现状与局限**——0.8.x 仅支持 1P1D、缺负载均衡与自动扩缩容、Chunk Prefill 未适配 + - **核心洞见:"短序列/低频请求场景下,融合部署可能更优"——但标题宣称的"成本直降60%"在正文中并无实测数据支撑,量化收益有被高估风险** - 生态层: [如何使用 NVIDIA Dynamo 减少 KV 缓存瓶颈](https://developer.nvidia.cn/blog/how-to-reduce-kv-cache-bottlenecks-with-nvidia-dynamo/) - - 摘要:[查看](../NVIDIA_技术博客/2025-09-18_如何使用_NVIDIA_Dynamo_减少_KV_缓存瓶颈_摘要.md) + - 摘要:[查看](./NVIDIA_技术博客/2025-09-18_如何使用_NVIDIA_Dynamo_减少_KV_缓存瓶颈_摘要.md) + - NVIDIA / 技术博客 + - **KV 缓存是显存瓶颈**——随提示长度线性增长且必须驻留 HBM,长上下文下迫使在删缓存重算、限制上下文、增加 GPU 之间权衡 + - **KVBM 三层架构**——模型集成层(TensorRT-LLM/vLLM)解耦引擎差异;内存管理层可自定义卸载策略;NIXL 传输层统一接入 CPU/SSD/文件系统/云存储 + - **卸载适用条件**——仅当缓存重用收益超过传输开销时合算:长会话、高并发、共享前缀、受内存/成本限制的部署 + - **第三方实测**——Vast 单 H100 经 GDS 插件达 35GB/s;WEKA 8×H100 达 270GB/s 读取 + - **核心洞见:"在 GPU 显存中长时间保留大量 KV cache 是不可扩展的"——给出"何时卸载"的明确边界条件,而非无条件方案推销** - [开源推理平台](https://kvcache-ai.github.io/Mooncake/index.html) - ![-](./金鹏/20260806/20260806-005-thumb.png) - ![-](./金鹏/20260806/20260806-005.png) - **Mooncake、NVIDIA Dynamo、llm-d、AIBrix——工业级开源平台把 PD分离 与分布式 KV Cache、智能路由、K8s 编排组合成完整推理底座。** - 总纲: [Mooncake(KVCache 中心化解耦架构)](https://kvcache-ai.github.io/Mooncake/index.html) - - 摘要:[查看](../Mooncake_项目/2026-08-06_Welcome_to_Mooncake_摘要.md) + - 摘要:[查看](./Mooncake_项目/2026-08-06_Welcome_to_Mooncake_摘要.md) + - Mooncake / 项目官网(月之暗面) + - **开源组件全景**——核心组件 Transfer Engine(RDMA 高速传输)与 Mooncake Store(分布式 KVCache 池)均已开源 + - **生态集成是主要影响力路径**——vLLM、SGLang(HiCache/EPD)、TensorRT-LLM、LMDeploy、LMCache、FlexKV(腾讯)等相继接入 + - **量化收益**——Kimi-K2 权重更新跨数千 GPU 从 53s 降至 7.2s;128 块 H200 上实现 224k/288k tokens/sec 预填充/解码吞吐 + - **FAST'25 最佳论文背书**——2025 年 2 月获存储领域顶会最佳论文,配套 traces 已开源 + - **核心洞见:一条时间线浓缩 2024-2026 年推理基础设施生态演进——"以 KVCache 为中心 + 分离式"已成为行业共同技术方向(内容为项目自述,无失败教训与边界讨论)** - 生态层: [NVIDIA Dynamo(引擎无关的推理编排)](https://docs.nvidia.com/dynamo/latest/index.html) - - 摘要:[查看](../NVIDIA_Dynamo_文档/2026-08-06_Welcome_to_NVIDIA_Dynamo_摘要.md) + - 摘要:[查看](./NVIDIA_Dynamo_文档/2026-08-06_Welcome_to_NVIDIA_Dynamo_摘要.md) + - NVIDIA / 官方文档 + - **引擎无关的前端 + Worker 模型**——OpenAI 兼容网关与推理引擎解耦,后端可在 SGLang/vLLM/TensorRT-LLM 间切换 + - **外部协调依赖**——运行需 docker compose 拉起 etcd(服务发现)与 NATS(消息通信),部署门槛高于单体推理服务 + - **低门槛验证路径**——Qwen3-0.6B 小模型 + curl 一条命令即可验证端到端,几分钟跑通 + - **核心洞见:首页宣称"高性能、低延迟、任何部署规模"但全文无任何基准测试——仅适合作为上手路径而非认知材料** - 生态层: [llm-d(K8s 原生分布式推理栈)](https://llm-d.ai/docs/architecture) - - 摘要:[查看](../llm-d/2026-08-06_llm-d_K8s原生分布式推理栈架构_摘要.md) + - 摘要:[查看](./llm-d/2026-08-06_llm-d_K8s原生分布式推理栈架构_摘要.md) + - llm-d / 项目官网(CNCF Sandbox) + - **三层抽象解耦清晰**——Router(Envoy L7 代理 + 端点路由引擎)/ InferencePool(按模型分组的"LLM 优化 Service")/ Model Server(vLLM/SGLang 推理引擎) + - **Variant 用标签表达服务角色**——prefill/decode 等差异通过 Pod 标签而非专用资源表达,设计轻巧 + - **KV cache 成为一等调度信号**——前缀缓存感知路由 + 事件驱动 KV 索引 + CPU/SSD 分层卸载,把"缓存命中率"纳入路由打分 + - **核心洞见:K8s 原生推理平台的可借鉴架构范式——但全文档零基准测试、零生产案例,XGBoost 延迟预测等关键工程问题成熟度无从判断** - 生态层: [AIBrix(字节跳动云原生推理)](https://github.com/vllm-project/aibrix) - - 摘要:[查看](../GitHub/字节跳动/2026-06-16_AIBrix_云原生推理_摘要.md) + - 摘要:[查看](./GitHub/字节跳动/2026-06-16_AIBrix_云原生推理_摘要.md) + - 字节跳动 / GitHub + - **发布节奏反映产品成熟度**——2024-11 至 2026-06 共 8 个版本(0.1.0→0.7.0),v0.2.1 即支持 DeepSeek-R1 全权重部署 + - **三支柱能力框架**——LLM 感知的网关路由(前缀感知/负载感知)、基于实时需求的自动扩缩、分布式 KV Cache 跨节点复用 + - **K8s + Ray 混合编排**——用 Kubernetes 管集群、用 Ray 执行细粒度任务,是字节大规模算力治理经验的工程化表达 + - **核心洞见:托管于 vllm-project 组织、白皮书公开于 arXiv:2504.03648——特性清单可作同类平台功能对照表,但 README 无法支撑任何性能结论** - 总纲: [cr7258/ai-infra-learning · Lesson 06 PD分离(系统化课程)](https://github.com/cr7258/ai-infra-learning/tree/main/lesson/06-disaggregating-prefill-and-decoding) - - 摘要:[查看](../GitHub/cr7258/2026-08-06_Lesson_06_PD分离推理架构详解_摘要.md) + - 摘要:[查看](./GitHub/cr7258/2026-08-06_Lesson_06_PD分离推理架构详解_摘要.md) + - cr7258 / GitHub 课程(ai-infra-learning) + - **逻辑链条完整**——指标问题(Goodput vs Throughput)→ 干扰证据(1.8x/12.6x)→ 分离方案 → KV 传输全栈(开销/中心存储 vs P2P/三类链路/三种粒度)→ vLLM KV Connector 实现 → 方案对比 + - **数据有出处、计算有过程**——明确区分论文数据与工程事实,论据纪律良好 + - **PD 分离 vs chunked-prefills 是权衡而非胜负**——必须同时满足双 SLO 时 PD 分离更优,这是全文边界意识最强的部分 + - **核心洞见:一篇文章讲透 PD 分离——vLLM KV Connector(SharedStorage/NCCL P2P/NIXL/LMCache/Multi)已是社区实现的事实标准抽象** - [推理解耦学术前沿](https://arxiv.org/abs/2401.09670) - ![-](./金鹏/20260806/20260806-006-thumb.png) - ![-](./金鹏/20260806/20260806-006.png) - **从 DistServe 的 Goodput 革命到 AFD 的算子级解聚——五篇论文勾勒推理解耦从“阶段分离”走向“算子分离”的演进谱系。** - 根基层: [DistServe: Disaggregating Prefill and Decoding for Goodput-optimized LLM Serving](https://arxiv.org/abs/2401.09670) - - 摘要:[查看](../arXiv/Yinmin_Zhong/2024-01-18_DistServe_摘要.md) + - 摘要:[查看](./arXiv/Yinmin_Zhong/2024-01-18_DistServe_摘要.md) + - Yinmin Zhong 等(UCSD) / arXiv:2401.09670 + - **"干扰 + 耦合"双重病因**——混批使解码步被 prefill 步拖慢、TTFT 与 TPOT 相互挤压;共享权重与显存迫使两阶段用同一并行策略 + - **解耦收益量化**——13B 模型单 A100 混合部署仅 1.6 rps goodput;2:1 GPU 配比分离后整体 goodput 达 10 rps(每 GPU 3.3 rps),是原方案的 2.1× + - **goodput 目标重塑优化函数**——以"每 GPU 满足 SLO 达标率(90%)的最大请求率"为目标,直接对应单次查询成本 + - **"拉取式"KV 传输抗突发**——decode 实例按需从 prefill 拉取 KV,prefill 显存充当排队缓冲,两类实例无需复杂协调 + - **核心洞见:PD 分离的开山之作——但解耦引入实例间依赖,单个 decoding 实例故障可能连带多个 prefill 实例、瘫痪整个服务** - 根基层: [Splitwise: Efficient Generative LLM Inference Using Phase Splitting](https://arxiv.org/abs/2311.18677) - - 摘要:[查看](../arXiv/Pratyush_Patel/2023-11-30_Splitwise_摘要.md) + - 摘要:[查看](./arXiv/Pratyush_Patel/2023-11-30_Splitwise_摘要.md) + - Pratyush Patel 等(Stanford) / arXiv:2311.18677 + - **硬件失衡是动因**——H100 相对 A100 算力提升 3.43× 但内存带宽仅增长 1.6×,最新 GPU 的算力优势在内存密集的 token 生成阶段被浪费 + - **逐层异步传输与计算重叠**——KV cache 迁移开销与 prompt 计算重叠,E2E 延迟影响仅 0.8%(串行传输为 3%) + - **异构集群设计矩阵**——AA/HH/HA/HHcap 四类;HA 用 H100 跑 prompt + A100 跑 token,token 阶段 A100 更划算 + - **量化收益**——相比现有集群成本降 20% 同时吞吐提升 1.4×,同等成本与功耗预算下可提供 2.35× 吞吐 + - **核心洞见:与 DistServe 同期提出阶段拆分但出发点不同——Splitwise 强调异构硬件选型与成本/功耗优化(Perf/$ 与 Perf/W),"token 生成并不需要最新 GPU"** - 根基层: [TetriInfer: Inference without Interference](https://arxiv.org/abs/2401.11181) - - 摘要:[查看](../arXiv/Cunchen_Hu/2024-01-20_TetriInfer_摘要.md) + - 摘要:[查看](./arXiv/Cunchen_Hu/2024-01-20_TetriInfer_摘要.md) + - Cunchen Hu 等(上海交大/微软) / arXiv:2401.11181 + - **混合负载干扰实测**——混跑 prefill 请求 10× 减速、prefill+decode 混跑 5× 减速、不同长度 decode 混跑吞吐损失 16% + - **三支柱设计**——定长 chunk 切分使硬件贴近计算饱和点;prefill/decode 虚拟实例解耦(独立扩缩容、可角色翻转);两级调度 + 小 LLM 长度预测(200 token 粒度准确率 74.9%) + - **量化收益**——相比 vLLM 资源减少 38%、平均 TTFT 降低 97%、平均 JCT 降低 47%;轻 prefill 重 decode 负载 perf/$ 提升 2.4× + - **核心洞见:不应把所有请求当同类处理,应按 prefill/decode 长度分类调度(像俄罗斯方块一样组织请求)——并诚实标注重 prefill+重 decode 负载不适用的边界** - 根基层: [Mooncake: A KVCache-centric Disaggregated Architecture](https://arxiv.org/abs/2407.00079) - - 摘要:[查看](../arXiv/Ruoyu_Qin/2024-06-24_Mooncake_摘要.md) + - 摘要:[查看](./arXiv/Ruoyu_Qin/2024-06-24_Mooncake_摘要.md) + - Ruoyu Qin 等(月之暗面) / arXiv:2407.00079 + - **KVCache 是调度的中心矛盾**——复用 KVCache 减少计算与增大 batch 提高 MFU 都会伤及延迟 SLO,调度本质是在缓存复用与 SLO 之间权衡 + - **分层解耦缓存池**——利用闲置 CPU/DRAM/SSD 构建 KVCache 分层存储与分发网络,热块复制防拥塞、冷块换出降成本 + - **Conductor 缓存感知全局调度**——按前缀匹配长度/排队时间/传输时间估算 TTFT 选最优实例,不满足 SLO 直接返回 HTTP 429 + - **预测式早期拒绝**——避免为注定被拒绝的请求浪费 prefill 算力,抑制拒绝策略引发的 P/D 负载反相振荡(拒绝请求数从 4183 降到 3589) + - **核心洞见:"与传统研究假设所有请求都会被处理不同,Mooncake 面对的是严重过载场景"——以 SLO 满足度而非请求数/容量比衡量系统负载** - 根基层: [How Far Can Disaggregation Go? Attention-FFN Disaggregation (AFD)](https://arxiv.org/abs/2605.28302) - - 摘要:[查看](../arXiv/Hanjiang_Wu/2026-05-27_AFD_How_Far_Can_Disaggregation_Go_摘要.md) + - 摘要:[查看](./arXiv/Hanjiang_Wu/2026-05-27_AFD_How_Far_Can_Disaggregation_Go_摘要.md) + - Hanjiang Wu 等(Georgia Tech + Intel + Google) / arXiv:2605.28302 + - **解耦粒度演化谱系**——chunked-prefill 聚合 → P/D 阶段解耦 → AFD 算子级解耦(Attention 与 FFN 拆到不同 GPU 组),每层解耦都加深调度设计空间 + - **严格 SLO 下 AFD 使不可能变为可能**——DeepSeek-V3.2 上以 TTFT<150ms、TPOT≤15ms 约束,AFD 部署维持约 4k tokens/s 系统吞吐,而非 AFD 部署不可行 + - **反直觉的极端配比**——MLA+稀疏注意力把 524k 前缀 KV cache 压进 2 卡 HBM,长上下文 agentic 负载下最优配置为 2A+126F(几乎整个集群给 FFN) + - **位置感知放置原则**——高频层内 A2F/F2A 流量绑最高带宽 NVLink 域,低频跨节点 KV 传输走 InfiniBand;内存分割让 attention GPU 腾出显存装 KV 是隐藏收益 + - **核心洞见:"提供一张实用地图:MoE 规模化服务中,何时、何处更深层的解耦才真正划算"——纯吞吐下聚合部署常胜,AFD 赢在严格 SLO 与超长前缀战场** - 认知层: [当 PD 分离成为标配,推理的未来在 AFD](https://mp.weixin.qq.com/s/5YsLOl4oIfHzNdi8pbmURQ) - - 摘要:[查看](../微信公众平台/小哥人工智能笔记/2026-08-05_当PD分离成为标配_推理的未来在AFD_摘要.md) + - 摘要:[查看](./微信公众平台/小哥人工智能笔记/2026-08-05_当PD分离成为标配_推理的未来在AFD_摘要.md) + - 小哥人工智能笔记 / 微信公众平台 + - **解聚三级跳框架**——chunked-prefill(切块减气泡)→ P/D 分离(算力 vs 带宽错配)→ A/F 解聚(块内访存 vs 计算错配),AFD 是"叠在 PD 之上的下一级解聚"而非替代者 + - **块内异构量化证据**——长上下文下 Attention 运行时占比从 41% 飙到 87%-96%,且不同架构斜率不同,故 A/F 配比"没有统一答案" + - **"AFD 不是银弹"的边界**——纯吞吐下聚合部署(chunked-prefill + EP)在大多数面板胜出;AFD 每个副本消耗更多 GPU + - **AFD 的两个确定性战场**——严格 SLO 下只有 AFD 类方案可行(约 4k tokens/s);1M 前缀场景非 AFD 直接不可行——内存切分本质是"给 KV 腾地方",此处它不是"更快"而是"能跑" + - **核心洞见:"先定 SLO,再谈解聚"——国产芯片(昇腾 HCCS、昆仑芯 XPU-Link)与"层内高频绑节点内"原则契合,但国产实测仍是空白** - [网络与存储基础设施](https://quant67.com/post/llm-infra/04-interconnect/04-interconnect.html) - ![-](./金鹏/20260806/20260806-007-thumb.png) - ![-](./金鹏/20260806/20260806-007.png) - **推理集群网络 200G RoCE 即可起步、KV Cache 按 HBM→DRAM→SSD 分层卸载——网络与存储是 PD分离 落地的隐形底座。** - 根基层: [大模型基础设施工程 04:互联与网络——NVLink、InfiniBand](https://quant67.com/post/llm-infra/04-interconnect/04-interconnect.html) - - 摘要:[查看](../土法炼钢兴趣小组的算法知识备份/2026-04-22_大模型基础设施工程04_互联与网络_NVLink_InfiniBand_RoCE_与国产替代_摘要.md) + - 摘要:[查看](./土法炼钢兴趣小组的算法知识备份/2026-04-22_大模型基础设施工程04_互联与网络_NVLink_InfiniBand_RoCE_与国产替代_摘要.md) + - 土法炼钢兴趣小组 / 算法知识备份 + - **算力决定上限,互联决定利用率**——同一批 H100 接不同网络,70B 模型训练 MFU 可相差 30 个百分点以上 + - **NVL72 把机柜变成一块 GPU**——72 卡全 NVLink 互联,TP/EP 可一柜内完成,堪称 MoE 模型(如 DeepSeek-R1)的天选硬件 + - **IB 是黄金标准但贵且锁死**——SHARP 在网计算、无损流控,每端口价格为等速以太网 2-3 倍,生态被 NVIDIA 牢牢掌控;RoCEv2 是国内大厂务实之选(省钱 30%-50%)但调优门槛极高 + - **fail-slow 比 fail-stop 更可怕**——网卡降速不报错会拖慢整个 step,需靠 per-rank AllReduce 时间监控发现 + - **核心洞见:排障案例显示 4096 卡 MFU 从 28% 提升到 46%,靠的是 peermem 加载、DCQCN 调参、多 QP 打散等小优化叠加——全程没有"致命 bug"** - 认知层: [InfiniBand vs 以太网 GPU 集群对比:800G 网络架构决策指南](https://introl.com/zh/blog/infiniband-vs-ethernet-gpu-clusters-800g-architecture) - - 摘要:[查看](../Introl/2026-03-27_InfiniBand_vs_以太网_GPU_集群对比_800G_网络架构决策指南_摘要.md) + - 摘要:[查看](./Introl/2026-03-27_InfiniBand_vs_以太网_GPU_集群对比_800G_网络架构决策指南_摘要.md) + - Introl + - **拥塞行为是最大差异**——高负载下 IB 优雅降级,以太网在 incast 场景可能性能崩溃,两者延迟差距从基线 2 倍扩大到 100 倍 + - **成本账的两面性**——IB 硬件贵约 2 倍(千卡集群约 1500 万 vs 700 万美元),但运维开销约低 40%、功耗省 15% + - **成功案例两极分化**——Selene(IB,95% 扩展效率)与 Google TPU(纯以太网加自研 Jupiter)都成功,但前者靠 NVIDIA 资源、后者靠数百名网络博士 + - **技术收敛进行时**——Spectrum-X 800G 把 IB 能力搬到以太网,UEC 1.0 规范已发布,2027 年前后选择可能不再关键 + - **核心洞见:"连接 1 万块 GPU 的网络,决定了它们是一台统一超算还是一堆昂贵孤立处理器"——大规模训练选 IB、推理服务选以太网、混合部署是常见折中** - 认知层: [GTC 解读:当我们谈论 AI 推理的 KV Cache](https://www.geekpark.net/news/361648) - - 摘要:[查看](../极客公园/2026-03-25_GTC_解读_当我们谈论_AI_推理的_KV_Cache_我们在做什么_摘要.md) + - 摘要:[查看](./极客公园/2026-03-25_GTC_解读_当我们谈论_AI_推理的_KV_Cache_我们在做什么_摘要.md) + - 极客公园 / 阿里云资深技术总监张为 GTC 2026 演讲 + - **三重压力叠加的内存墙**——显存贵、上下文长、并发高,KV Cache 需求指数级增长,上下文从 4K 扩至 256K+ 使内存压力激增 8-16 倍 + - **HiCache 分层缓存**——与 SGLang 社区共建,显存-内存-3FS 多级卸载与全局共享:命中率 80%、TTFT 降 56%、QPS 翻倍 + - **VLCache 多模态缓存**——首次形式化"累积复用误差效应",层感知动态重计算,仅计算 2-5% tokens 即准确率持平,TTFT 加速 1.2-16 倍 + - **HiSim 高保真仿真**——与 NVIDIA Dynamo 共建的事件驱动仿真器,仿真成本降 39 万倍、端到端误差<5%,把容量决策从经验转向数据 + - **核心洞见:"KV Cache 的本质是'以内存换算力'"——互联网缓存三件套(统一接口/多级存储/预计算)平移到 AI 的 KV 抽象层,G3.5 定制存储与 HBF 高带宽闪存是未来方向** - 认知层: [KV Cache 缓存可卸载至 SSD:打破内存墙限制](https://www.fxbaogao.com/detail/5116282) - - 摘要:[查看](../发现报告/国泰海通证券/2025-10-28_KV_Cache_缓存可卸载至_SSD_打破内存墙限制_AI_SSD迎来广阔成长空间_摘要.md) + - 摘要:[查看](./发现报告/国泰海通证券/2025-10-28_KV_Cache_缓存可卸载至_SSD_打破内存墙限制_AI_SSD迎来广阔成长空间_摘要.md) + - 国泰海通证券 / 发现报告 + - **分级卸载成为行业方向**——英伟达 Dynamo/KVBM 支持 G1-G4(GPU 显存/CPU 内存/SSD/远端存储)四级 KV Cache 卸载 + - **三星 SSD 卸载量化收益**——KV Cache 超容时 TTFT 最高降 66%、ITL 最高降 42%,多轮对话 KV 重用使 I/O 吞吐稳步上升 + - **HDD 缺口催化 NAND 转产**——TrendForce 数据显示 NAND 厂商转产 122TB/245TB 超大容量 Nearline SSD + - **核心洞见:"KV Cache 缓存可从 GPU 内存 offload 至 CPU、SSD"——推理侧容量增长超出 HBM 承载能力,AI SSD 迎来成长空间(研报题材,论据深度有限)** - 生态层: [Tair KVCache - 动态分级缓存(阿里云)](https://www.aliyun.com/product/kvcache) - - 摘要:[查看](../阿里云/2025-09-23_Tair_KVCache_动态分级缓存_LLM推理缓存_数据库_阿里云_摘要.md) + - 摘要:[查看](./阿里云/2025-09-23_Tair_KVCache_动态分级缓存_LLM推理缓存_数据库_阿里云_摘要.md) + - 阿里云 / 产品介绍页 + - **"以存代算"**——将 KV 缓存卸载至分布式池化存储,用存储资源置换 GPU 算力,是全文核心卖点 + - **多级存储池化**——对 GPU HBM、DRAM 等多级存储统一池化管理,是主流缓存架构方向 + - **三类场景覆盖**——多轮对话(Redis 语义接口保证连贯性)、海量并发(亲和性路由)、RAG(预检索内容缓存) + - **核心洞见:印证 KV 缓存池化/卸载已成为主流云厂商产品化方向(与 NVIDIA Dynamo、Mooncake 相互呼应)——但全文零技术细节、零性能数据,仅具线索价值** - [Token经济与算力经营](https://introl.com/zh/blog/inference-unit-economics-true-cost-per-million-tokens-guide) - ![-](./金鹏/20260806/20260806-008-thumb.png) - ![-](./金鹏/20260806/20260806-008.png) - **每百万 token 成本三年从 20 美元降到 0.4 美元,算力资产正从“卖卡”走向“Token 工厂”经营——PD分离 是降本侧的工序。** - 根基层: [推理单位经济学:每百万 Token 的真实成本](https://introl.com/zh/blog/inference-unit-economics-true-cost-per-million-tokens-guide) - - 摘要:[查看](../Introl/2026-02-09_推理单位经济学_每百万Token的真实成本_摘要.md) + - 摘要:[查看](./Introl/2026-02-09_推理单位经济学_每百万Token的真实成本_摘要.md) + - Introl + - **成本年降 10 倍**——同等性能从 2022 年底每百万 token 20 美元降至 0.40 美元,快于 PC 算力与互联网带宽的历史速度 + - **利用率决定自托管可行性**——10% 利用率使每千 token 0.013 美元的成本放大 10 倍至 0.13 美元,超过高端 API;7B 模型需 50% 利用率、13B 仅需 10% 即可收支平衡 + - **日均 8000 次对话为最小可行阈值**——低于此规模,自托管的固定成本与运维复杂性超过节省 + - **优化技术复合效应**——量化(4×)×连续批处理(2×)×推测解码(2×)可达 16 倍有效成本降低 + - **核心洞见:"掌握推理经济学决定了 AI 部署是创造价值还是消耗资本"——把成本决策从感觉变为可计算的框架(利用率方程 + 收支平衡点 + 请求量阈值)** - 战略层: [底座算力跃迁到 token 工厂的新机会](https://www.fxbaogao.com/detail/5481471) - - 摘要:[查看](../中邮证券/孙业亮_刘聪颖/2026-06-16_中邮证券_底座算力跃迁到token工厂的新机会_摘要.md) + - 摘要:[查看](./中邮证券/孙业亮_刘聪颖/2026-06-16_中邮证券_底座算力跃迁到token工厂的新机会_摘要.md) + - 中邮证券 / 孙业亮、刘聪颖 + - **Token 成为结算单位**——2026 年 3 月我国日均 Token 调用量超 140 万亿,较 2024 年初增长 1000 多倍;中国 Token 调用占全球 36% + - **成本结构拆解**——训练阶段 CAPEX 主导(千亿参数总成本 1-5 亿美元);推理阶段 OPEX 主导(电力占 60%-70% 为最大单项开支) + - **定价锚转移**——当前芯片可获取性决定 Token 供给与价格;中期电力成为物理硬约束;长期人才与知识密度主导溢价 + - **国内玩家布局**——阿里 Token Foundry(按场景定制词元工作流)、华为 Token Factory(昇腾+液冷+储能)、腾讯 TokenHub(统一计费) + - **核心洞见:"Token 工厂正在把数据中心从基础设施行业推向制造业,而制造业的核心从来不是规模,而是效率"——研报荐股属性,长期预测无公开模型支撑** - 总纲: [大模型推理优化关键技术与应用实践研究报告(中国信通院)](https://www.caict.ac.cn/kxyj/qwfb/ztbg/202604/P020260415615308750699.pdf) - - 摘要:[查看](../中国信通院/中国信息通信研究院人工智能研究所/2026-03-31_大模型推理优化关键技术与应用实践研究报告_2026年_摘要.md) + - 摘要:[查看](./中国信通院/中国信息通信研究院人工智能研究所/2026-03-31_大模型推理优化关键技术与应用实践研究报告_2026年_摘要.md) + - 中国信息通信研究院人工智能研究所 + - **推理取代训练成为落地焦点**——ChatGPT 企业版 API Token 消耗 12 个月暴增 320 倍;2026 年推理占计算工作负载 66%,中国推理算力市场规模 876.5 亿元(近翻倍) + - **三级优化体系**——模型层(量化/蒸馏/MoE/MLA 低秩压缩)、引擎层(PagedAttention 并发 +3 倍、FlashAttention、混合并行、Chunked-Prefills)、系统层(PD/AF 分离、调度策略、高性能存储) + - **工业级方案实测**——Mooncake 有效吞吐 +75%、长上下文最高 +525%;UCM(华为)TTFT 最高降 90%、吞吐最大提升 22 倍;MegaScale-Infer 单 GPU 解码吞吐较 vLLM 提升 7.11 倍 + - **AF 分离标志架构演进**——将 MoE 的 Attention(访存密集)与 Feedforward(计算密集)拆分至异构节点独立扩展,从阶段分治迈向模块分治 + - **核心洞见:"大模型推理是 AI 从实验室走向产业应用的'最后一公里'"——推理优化 = 在保障 SLO 前提下兼顾"效果-性能-成本"的全链路工程** - [AI组织与宏观](https://mp.weixin.qq.com/s/AgMLIqbA6PeGW7phFJAvOg) - ![-](./金鹏/20260806/20260806-009-thumb.png) - ![-](./金鹏/20260806/20260806-009.png) - **AI 浪潮之上:组织如何从分散提效走向 AI Native,美国政治反弹如何改写扩张模式——宏观变量决定技术落地的节奏。** - 实践层: [从分散提效到 AI Native 组织的实践](https://mp.weixin.qq.com/s/AgMLIqbA6PeGW7phFJAvOg) - - 摘要:[查看](../微信公众平台/数字人BuilderAgent团队/2026-08-06_从分散提效到_AI_Native_组织的实践_摘要.md) + - 摘要:[查看](./微信公众平台/数字人BuilderAgent团队/2026-08-06_从分散提效到_AI_Native_组织的实践_摘要.md) + - 数字人BuilderAgent团队 / 微信公众平台 + - **单点提效悖论**——全员接入 AI 后人人感觉效率提升,但整体交付周期没有等比缩短:80%+ 周期消耗在角色间等待、交接与信息损耗上 + - **流动效率度量**——核心指标 = 真正干活时间 ÷ 总交付周期,单点 AI 优化撬不动流程性损耗 + - **AI 提效分级 L1/L2/L3**——三级的本质区别是 Context 归属(依赖多少"人类独有、AI 当前不具备"的 context),而非 AI 能力高低 + - **Spec 作为单一事实源 + 缺陷回流闭环**——验收标准必须"可被 QA 自动判定";缺陷转化为新验收标准写回 Spec,防止同类缺陷复发 + - **核心洞见:"围绕 AI 重新设计流程与组织,而不是把 AI 缝进旧流程"——"我们得到的只是'更快的局部',而不是'更短的整体'"** - 战略层: [美国镜鉴:当AI浪潮遭遇政治反弹](https://mp.weixin.qq.com/s/OLxrS_jzJqz0z6bKIJMsfA) - - 摘要:[查看](../微信公众平台/CF40研究部/2026-07-28_美国镜鉴_当AI浪潮遭遇政治反弹_摘要.md) + - 摘要:[查看](./微信公众平台/CF40研究部/2026-07-28_美国镜鉴_当AI浪潮遭遇政治反弹_摘要.md) + - CF40 研究部 / 微信公众平台 + - **政治反弹三战线**——劳动者争夺部署协商权与补偿分享权、公众质疑科技巨头对数据与规则制定权的垄断、地方社区反对数据中心转嫁电力水资源成本 + - **历史规律**——赋能型技术提高生产率易被接受、替代型技术导致技能贬值易引发抵制;反弹对象随技术形态演变:机器→垄断企业→选举政治 + - **数据中心是反弹最清晰的焦点**——收益归企业、成本归社区(电价上涨 20-25%、就业仅 20-50 人/站);2026 年 Q1 至少 75 个约 1300 亿美元项目因地方反对被取消或延期 + - **政治临界点条件**——就业冲击显著 + 责任对象清晰 + 政治叙事整合;若失业率因 AI 上升两个百分点并形成"AI 应负责"的公共叙事,真正的民粹反弹可能开始 + - **核心洞见:"对 AI 的政治反弹最可能带来的变化,是终结 AI 产业不计社会成本的扩张模式"——公众态度由收益分配而非技术本身决定** - 生态层: [刚刚!谷歌突发最炸离职](https://mp.weixin.qq.com/s/5RcNh03rxFZMbJZKoKQvLw) - - 摘要:[查看](../微信公众平台/深科技首席/2026-08-06_刚刚_谷歌突发最炸离职_摘要.md) + - 摘要:[查看](./微信公众平台/深科技首席/2026-08-06_刚刚_谷歌突发最炸离职_摘要.md) + - 深科技首席 / 微信公众平台 + - **Jeff Dean 离职创业**——谷歌第 30 号元老员工、任职 27 年,出任 AI 科研公司 Discovery Loop CEO + - **全明星创始团队**——Ghemawat(MapReduce/GFS/Bigtable/Spanner 奠基)、Vinyals(Gemini/Seq2Seq)、Le(Google Brain/AutoML),四人包揽谷歌基建、初代 AI、Gemini 三代核心技术 + - **方向:AI 全自动科研闭环**——让 AI 自主提出猜想、设计实验、运行分析并迭代,先让 AI 研发 AI,再跨界芯片、新材料、新药、清洁能源 + - **"友好分手"的止损模式**——Alphabet 战略入股、谷歌云提供算力,作者解读为锁住深度合作关系的最优止损方案 + - **核心洞见:顶尖人才不再迷恋大厂光环——AI 核心赛场将从模型参数/对话体验转向"规模化、工程化的自动科学发现能力"(标题党快讯,细节需以官方公告核实)** -> **说明**:PD分离 主题下 45 条链接 + 3 条独立链接共 48 条全部完成摘要归档;今日头条转载版与 CSDN cr7258 版同源于《PD 分离推理架构详解》,复用其摘要。配图按主题分组生成(大图 2560×1440 + 列表标题图 160×90)。 ## 2026-07-31 - [企业AI落地](https://mp.weixin.qq.com/s/wD0aOLCrt3fbjaiGCCTEPQ)