文档(金鹏): 2026-08-06 章节 48 篇文章摘要归档

- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇)
- 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/
- 章节重组为 9 个主题分组并挂接摘要引用
This commit is contained in:
2026-08-06 18:00:50 +08:00
parent aa585542d1
commit c0ba3fb853
111 changed files with 13271 additions and 0 deletions
@@ -0,0 +1,72 @@
# llm-d:K8s 原生的分布式推理栈架构文档
> **来源**llm-d
> **作者**llm-d 项目团队(CNCF Sandbox 项目)
> **发布日期**2026-08-06
> **原文链接**https://llm-d.ai/docs/architecture
---
# Architecture
llm-d 架构高级指南。从这里开始,然后深入阅读具体指南。
## Core Components(核心组件)
llm-d 架构围绕三个主要概念构建:**Router(路由器)**、**InferencePool(推理池)** 和 **Model Server(模型服务器)**
- **llm-d Router** —— 推理请求的智能入口点。它提供 LLM 感知的负载均衡、请求排队和策略执行。由两个功能部分组成:
- **Proxy**:一个高性能 L7 代理(通常是 Envoy),接受用户请求,并通过 `ext-proc` 协议咨询 EPP 以确定最佳目标。
- **Endpoint Picker (EPP)**:路由引擎,基于实时指标、KV-cache 亲和性和配置的策略,对模型服务器 Pod 进行评分和选择。
- **InferencePool** —— 通过标签选择器对服务同一基础模型的 Model Server Pod 进行分组的 API。被概念化为"面向 LLM 优化的 Service",是 Router 的发现目标。此外:
- **Variant**InferencePool 内 Model Server Pod 的逻辑子分组,通过 Pod 标签而非专用资源来表达。Variant 根据共享特征(如服务角色(例如 prefill 或 decode)、成本概况、性能概况(吞吐量、延迟)或其他运营属性)来区分模型服务器。
- **Model Server** —— 在硬件加速器(GPU、TPU、HPU)上执行模型的推理引擎(如 vLLM 或 SGLang)。
![Basic llm-d Arch](https://llm-d.ai/img/versioned/0.8/assets/basic-architecture.svg)
## Advanced Patterns(高级模式)
llm-d 的核心设计可以扩展出可选的高级模式:
### KV Cache ManagementKV Cache 管理)
llm-d 提供了一个全面的生态系统,用于跨推理池管理和复用 KV cache,包括:
- **Prefix-Cache Aware Routing(前缀缓存感知路由)**:启发式和精确的技术以最大化缓存命中。
- **KV-Cache IndexingKV Cache 索引)**:跨所有模型服务器对缓存状态进行事件驱动的跟踪。
- **KV OffloadingKV 卸载)**:分层存储体系(CPU、SSD)以扩展缓存容量。
参见 KV Cache Management 了解这些组件如何组合的概述。
### Disaggregated Serving(分离式服务)
在分离式服务中,单个推理请求被拆分为多个阶段(例如 Prefill 和 Decode),由专门的 worker 处理。llm-d Router 通过同时选择 prefill 和 decode 端点并协调它们之间的 KV-cache 传输来编排这一流程。
参见 Disaggregation 了解完整细节。
### Predicted Latency-Based Routing(基于预测延迟的路由)
llm-d Router 可以通过"consultant"边车扩展,以提供用于路由决策的高级信号。主要实现是 **Latency Predictor**,它支持基于预测的 ITL 和 TTFT 的路由。
- **Latency Predictor**:在线训练 XGBoost 模型以预测请求延迟,用于更好的端点评分和 SLO 执行。
### Batch Inference(批推理)
批处理和离线推理工作负载由两个模块处理,可以独立或一起部署。**Batch Gateway** 提供 OpenAI 兼容的 Batch API 用于作业管理,而 **Async Processor** 通过流控门控分发排队的请求。组合使用时,Batch Gateway 将分发委托给 Async Processor。
参见 Batch Inference 了解批推理设计的细节。
### Autoscaling(自动扩缩容)
llm-d 通过两种互补的方法支持主动的、SLO 感知的自动扩缩容:
- **HPA/KEDA**:标准 Kubernetes 原生扩缩容,使用 EPP 导出的指标(如队列深度)。
- **Workload Variant Autoscaler (WVA)**:全局优化的扩缩容,通过在不同 variant 之间或跨推理池放置副本,在满足延迟目标的同时最小化成本。
参见 Autoscaling 了解完整细节。
![Advanced llm-d Arch](https://llm-d.ai/img/versioned/0.8/assets/images/llm-d-arch.svg)
---
> 文档版本:llm-d 0.8Docusaurus 文档站,CNCF 托管项目)。llm-d 是 Kubernetes 原生的分布式推理服务栈,使用 vLLM 作为模型服务引擎,Inference Gateway 作为请求调度器与负载均衡器,Kubernetes 作为基础设施编排与控制平面,面向大规模生产环境的 P/D 分离、分布式 KV Cache 与 SLO 感知调度。