Files
tech/知识/llm-d/2026-08-06_llm-d_K8s原生分布式推理栈架构.md
T
arno c0ba3fb853 文档(金鹏): 2026-08-06 章节 48 篇文章摘要归档
- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇)
- 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/
- 章节重组为 9 个主题分组并挂接摘要引用
2026-08-06 18:00:50 +08:00

73 lines
4.3 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# llm-d:K8s 原生的分布式推理栈架构文档
> **来源**llm-d
> **作者**llm-d 项目团队(CNCF Sandbox 项目)
> **发布日期**2026-08-06
> **原文链接**https://llm-d.ai/docs/architecture
---
# Architecture
llm-d 架构高级指南。从这里开始,然后深入阅读具体指南。
## Core Components(核心组件)
llm-d 架构围绕三个主要概念构建:**Router(路由器)**、**InferencePool(推理池)** 和 **Model Server(模型服务器)**
- **llm-d Router** —— 推理请求的智能入口点。它提供 LLM 感知的负载均衡、请求排队和策略执行。由两个功能部分组成:
- **Proxy**:一个高性能 L7 代理(通常是 Envoy),接受用户请求,并通过 `ext-proc` 协议咨询 EPP 以确定最佳目标。
- **Endpoint Picker (EPP)**:路由引擎,基于实时指标、KV-cache 亲和性和配置的策略,对模型服务器 Pod 进行评分和选择。
- **InferencePool** —— 通过标签选择器对服务同一基础模型的 Model Server Pod 进行分组的 API。被概念化为"面向 LLM 优化的 Service",是 Router 的发现目标。此外:
- **Variant**InferencePool 内 Model Server Pod 的逻辑子分组,通过 Pod 标签而非专用资源来表达。Variant 根据共享特征(如服务角色(例如 prefill 或 decode)、成本概况、性能概况(吞吐量、延迟)或其他运营属性)来区分模型服务器。
- **Model Server** —— 在硬件加速器(GPU、TPU、HPU)上执行模型的推理引擎(如 vLLM 或 SGLang)。
![Basic llm-d Arch](https://llm-d.ai/img/versioned/0.8/assets/basic-architecture.svg)
## Advanced Patterns(高级模式)
llm-d 的核心设计可以扩展出可选的高级模式:
### KV Cache ManagementKV Cache 管理)
llm-d 提供了一个全面的生态系统,用于跨推理池管理和复用 KV cache,包括:
- **Prefix-Cache Aware Routing(前缀缓存感知路由)**:启发式和精确的技术以最大化缓存命中。
- **KV-Cache IndexingKV Cache 索引)**:跨所有模型服务器对缓存状态进行事件驱动的跟踪。
- **KV OffloadingKV 卸载)**:分层存储体系(CPU、SSD)以扩展缓存容量。
参见 KV Cache Management 了解这些组件如何组合的概述。
### Disaggregated Serving(分离式服务)
在分离式服务中,单个推理请求被拆分为多个阶段(例如 Prefill 和 Decode),由专门的 worker 处理。llm-d Router 通过同时选择 prefill 和 decode 端点并协调它们之间的 KV-cache 传输来编排这一流程。
参见 Disaggregation 了解完整细节。
### Predicted Latency-Based Routing(基于预测延迟的路由)
llm-d Router 可以通过"consultant"边车扩展,以提供用于路由决策的高级信号。主要实现是 **Latency Predictor**,它支持基于预测的 ITL 和 TTFT 的路由。
- **Latency Predictor**:在线训练 XGBoost 模型以预测请求延迟,用于更好的端点评分和 SLO 执行。
### Batch Inference(批推理)
批处理和离线推理工作负载由两个模块处理,可以独立或一起部署。**Batch Gateway** 提供 OpenAI 兼容的 Batch API 用于作业管理,而 **Async Processor** 通过流控门控分发排队的请求。组合使用时,Batch Gateway 将分发委托给 Async Processor。
参见 Batch Inference 了解批推理设计的细节。
### Autoscaling(自动扩缩容)
llm-d 通过两种互补的方法支持主动的、SLO 感知的自动扩缩容:
- **HPA/KEDA**:标准 Kubernetes 原生扩缩容,使用 EPP 导出的指标(如队列深度)。
- **Workload Variant Autoscaler (WVA)**:全局优化的扩缩容,通过在不同 variant 之间或跨推理池放置副本,在满足延迟目标的同时最小化成本。
参见 Autoscaling 了解完整细节。
![Advanced llm-d Arch](https://llm-d.ai/img/versioned/0.8/assets/images/llm-d-arch.svg)
---
> 文档版本:llm-d 0.8Docusaurus 文档站,CNCF 托管项目)。llm-d 是 Kubernetes 原生的分布式推理服务栈,使用 vLLM 作为模型服务引擎,Inference Gateway 作为请求调度器与负载均衡器,Kubernetes 作为基础设施编排与控制平面,面向大规模生产环境的 P/D 分离、分布式 KV Cache 与 SLO 感知调度。