- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇) - 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/ - 章节重组为 9 个主题分组并挂接摘要引用
7.3 KiB
📊 文章摘要:当 PD 分离成为标配,推理的未来在 AFD
原文:2026-08-05_当PD分离成为标配_推理的未来在AFD.md 原文链接:https://mp.weixin.qq.com/s/5YsLOl4oIfHzNdi8pbmURQ 来源:微信公众平台(小哥人工智能笔记) 作者:小哥人工智能笔记 发布日期:2026-08-05(原文未标注明确日期,按下载日占位;解读论文 arXiv:2605.28302 为 2026-05) 摘要日期:2026-08-06 价值评级:⭐⭐⭐ 高
核心命题
算子级解聚 — 指出推理解聚的下一级是 AFD(Attention–FFN 解聚),并用 AIC++ 建模框架证明"解聚到哪一层、A/F 各配多少 GPU"应由模型驱动计算而非拍脑袋——这是本批文章中最具前瞻性的认知增量。
文章概要
本文解读 Georgia Tech + Intel + Google 等联合论文《How Far Can Disaggregation Go?》(arXiv:2605.28302),提出推理解聚"三级跳"演进:chunked-prefill → PD 分离 → 算子级 AFD(把 Attention 与 FFN 拆到不同 GPU 组)。论文以 AIC++ 协同设计框架(算子级计算建模 + AstraSim 网络仿真)在 128 卡 B200 上对四类 MoE 架构穷举搜索,核心结论:纯吞吐场景聚合部署常胜,但严格 SLO 下只有 AFD 可行(约 4k tokens/s),1M 前缀长上下文场景非 AFD 不可行(每 GPU 需求 298 GiB 超 B200 的 180 GiB,AFD 切分后降至 165 GiB)。价值在于把 PD 分离置于更大的演进脉络,并给出 rate-matching、位置感知放置、建模驱动等可落地原则;局限是数据全部来自论文仿真与原型,AFD 生产系统(vLLM PR)尚在早期。
关键要点
- 解聚三级跳框架 — chunked-prefill(切块减气泡)→ P/D 分离(算力 vs 带宽错配)→ A/F 解聚(块内访存 vs 计算错配);AFD 是"叠在 PD 之上的下一级解聚"而非替代者。
[分类: 范式突破] - 块内异构的量化证据 — 稠密 GQA 模型长上下文下 Attention 运行时占比从 4K 的 41%/59% 飙到 0.5M 的 87%/96%;Attention/FFN 占比随上下文单调上升且不同架构斜率不同,故 A/F 配比"没有统一答案"。
[分类: 共识] - AIC++ 建模框架 — 融合 AIConfigurator 算子级计算建模与 AstraSim 包粒度网络仿真,把"A 配几个 GPU、F 配几个 GPU"变成可求解的设计空间问题;四阶段微批重叠给出闭式解 t_pipe = M·s_max + Σ(s_i/L),把吞吐上限显式绑定到瓶颈资源的稳态速率——这是"建模驱动替代拍脑袋"的方法论核心。
[分类: 范式突破] - 位置感知 GPU 放置 — 频率驱动:高频层内 A2F/F2A 流量绑节点内 NVLink,低频 KV 传输走跨节点 InfiniBand;对照实验显示该放置带来 18× 的 KV 传输加速(25 GB/s → 450 GB/s)。
[分类: 共识] - "AFD 不是银弹"的边界 — 128 卡穷举搜索显示:纯吞吐下聚合部署(chunked-prefill + EP)在大多数面板胜出,解聚仅在更宽搜索暴露非对称副本形状时才赢;AFD 每个副本消耗更多 GPU。
[分类: 共识] - AFD 的两个确定性战场 — 严格 SLO(TTFT≤150ms/TPOT≤15ms)下只有 AFD 类方案可行(约 4k tokens/s,非 AFD 全红叉);1M 前缀场景非 AFD 直接不可行——AFD 的内存切分本质是"把权重/激活从 Attention GPU 挪走给 KV 腾地方",此处它不是"更快"而是"能跑"。
[分类: 共识] - 反直觉最优布局与 A/F 翻转 — DeepSeek-V3.2 的 MLA+稀疏注意力把 524K 前缀塞进 2 卡 HBM 后,2A+126F 布局反成最优;同模型吞吐最优布局会随上下文与 TTFT 预算在 96A+32F 与 FFN 密集间来回翻转——印证固定比例部署的脆弱。
[分类: 未探索] - 国产芯片的落地土壤 — 昇腾 HCCS、昆仑芯 XPU-Link 等节点内高带宽互联与"层内高频绑节点内"放置原则高度契合;国产 MoE 大模型(DeepSeek/Qwen 系列)完全适用 AFD 建模框架,但国产芯片上的 AFD 实测仍是空白。
[分类: 未探索]
批判性分析
假设前提
立论建立在四个前提上:MoE 是主流大模型架构(结论对稠密模型适用性弱);数据中心存在 scale-up/scale-out 两级网络拓扑且节点内带宽显著高于跨节点;用户有可量化的 SLO 预算("先定 SLO,再谈解聚");AIC++ 的算子级计算建模数据库(基于 NVIDIA AIConfigurator 实测)对目标集群成立。
论据与逻辑
证据链在同类文章中属于上乘:128 卡 B200、四类架构(Qwen3-235B/GPT-OSS-120B/Nemotron3-120B/DeepSeek-V3.2)、三类负载穷举式设计空间搜索,结论 1(吞吐)与结论 2(交互性)分开表述且各自给出反例(AFD 单独赢下 GPT-OSS chat 面板、Nemotron 吞吐翻倍),边界刻画诚实。但全部数据来自仿真(AstraSim)与定制 vLLM 原型,缺乏大规模生产实机验证;闭式模型的价值论述充分,其精度边界(仿真与实机的偏差)未量化。
边界与局限
作者明确给出适用边界:纯吞吐、无 SLO 场景聚合部署常胜,解聚不是越细越优;结论针对 MoE 模型,对稠密 GQA 模型(如 Qwen3-235B)需更宽 Attention 片,配比决策更复杂;1M 前缀结论基于 B200 的 180 GiB 显存上限,随显存增长该"唯一可行"优势会收窄;生产落地(vLLM PR #29772、StepMesh)仍在早期,A/F 双部配对、MoE router 迁移等实现细节的稳定性与生态成熟度未经检验。
可引用金句
"AFD 的价值不只是「更快」,更是在特定战场上「能不能跑」。"
"在 1M 前缀这种单 GPU 显存根本装不下模型+激活+KV 的场景里,AFD 不是「更快」,而是「能跑」。"
"先定 SLO,再谈解聚。"
总体评价
亮点:
- "解聚三级跳"框架清晰,把本批 PD 分离文章(DistServe 等)自然纳入更大演进脉络
- AIC++ 建模驱动方法论是真正的方法论增量:把经验性部署决策变成可解释、可外推的模型驱动决策
- 边界意识出色:明确"解聚不是银弹"、给出纯吞吐反例、指出固定 A/F 比例的脆弱
- 对国产芯片与智算中心的落地启示(rate-matching、放置原则)具有现实针对性
不足:
- 全部结论依赖论文仿真与原型,实机验证不足,关键数字(4k tokens/s、18×)应视为仿真估计
- 对 AIC++ 建模精度、仿真与实机偏差未作讨论
- 文章为 AI 解读系统生成,部分表述偏综述腔,深挖需回溯原论文
适用场景:智算中心与推理 Infra 团队做中长期技术规划(了解 PD 分离之后的演进方向);关心 MoE 模型规模化部署的架构师;长上下文(500K-1M)业务场景的方案选型参考。
关联建议:回溯原论文 arXiv:2605.28302 及其配套工具 AIConfigurator(arXiv:2601.06288)与 AstraSim;本批 PD 分离文章构成其前置知识(DistServe 的动机、marcus 的 vLLM 机制、丁师兄的落地代价);延伸阅读 Splitwise(arXiv:2311.18677)、MegaScale-Infer(arXiv:2504.02263)、vLLM AFD PR #29772 与 StepMesh,以及 ICML 2026《Theoretically Optimal Attention/FFN Ratios in Disaggregated LLM Serving》(arXiv:2601.21351)的最优 A/F 比闭式解。
