# llm-d:K8s 原生的分布式推理栈架构文档 > **来源**:llm-d > **作者**:llm-d 项目团队(CNCF Sandbox 项目) > **发布日期**:2026-08-06 > **原文链接**:https://llm-d.ai/docs/architecture --- # Architecture llm-d 架构高级指南。从这里开始,然后深入阅读具体指南。 ## Core Components(核心组件) llm-d 架构围绕三个主要概念构建:**Router(路由器)**、**InferencePool(推理池)** 和 **Model Server(模型服务器)**。 - **llm-d Router** —— 推理请求的智能入口点。它提供 LLM 感知的负载均衡、请求排队和策略执行。由两个功能部分组成: - **Proxy**:一个高性能 L7 代理(通常是 Envoy),接受用户请求,并通过 `ext-proc` 协议咨询 EPP 以确定最佳目标。 - **Endpoint Picker (EPP)**:路由引擎,基于实时指标、KV-cache 亲和性和配置的策略,对模型服务器 Pod 进行评分和选择。 - **InferencePool** —— 通过标签选择器对服务同一基础模型的 Model Server Pod 进行分组的 API。被概念化为"面向 LLM 优化的 Service",是 Router 的发现目标。此外: - **Variant**:InferencePool 内 Model Server Pod 的逻辑子分组,通过 Pod 标签而非专用资源来表达。Variant 根据共享特征(如服务角色(例如 prefill 或 decode)、成本概况、性能概况(吞吐量、延迟)或其他运营属性)来区分模型服务器。 - **Model Server** —— 在硬件加速器(GPU、TPU、HPU)上执行模型的推理引擎(如 vLLM 或 SGLang)。 ![Basic llm-d Arch](https://llm-d.ai/img/versioned/0.8/assets/basic-architecture.svg) ## Advanced Patterns(高级模式) llm-d 的核心设计可以扩展出可选的高级模式: ### KV Cache Management(KV Cache 管理) llm-d 提供了一个全面的生态系统,用于跨推理池管理和复用 KV cache,包括: - **Prefix-Cache Aware Routing(前缀缓存感知路由)**:启发式和精确的技术以最大化缓存命中。 - **KV-Cache Indexing(KV Cache 索引)**:跨所有模型服务器对缓存状态进行事件驱动的跟踪。 - **KV Offloading(KV 卸载)**:分层存储体系(CPU、SSD)以扩展缓存容量。 参见 KV Cache Management 了解这些组件如何组合的概述。 ### Disaggregated Serving(分离式服务) 在分离式服务中,单个推理请求被拆分为多个阶段(例如 Prefill 和 Decode),由专门的 worker 处理。llm-d Router 通过同时选择 prefill 和 decode 端点并协调它们之间的 KV-cache 传输来编排这一流程。 参见 Disaggregation 了解完整细节。 ### Predicted Latency-Based Routing(基于预测延迟的路由) llm-d Router 可以通过"consultant"边车扩展,以提供用于路由决策的高级信号。主要实现是 **Latency Predictor**,它支持基于预测的 ITL 和 TTFT 的路由。 - **Latency Predictor**:在线训练 XGBoost 模型以预测请求延迟,用于更好的端点评分和 SLO 执行。 ### Batch Inference(批推理) 批处理和离线推理工作负载由两个模块处理,可以独立或一起部署。**Batch Gateway** 提供 OpenAI 兼容的 Batch API 用于作业管理,而 **Async Processor** 通过流控门控分发排队的请求。组合使用时,Batch Gateway 将分发委托给 Async Processor。 参见 Batch Inference 了解批推理设计的细节。 ### Autoscaling(自动扩缩容) llm-d 通过两种互补的方法支持主动的、SLO 感知的自动扩缩容: - **HPA/KEDA**:标准 Kubernetes 原生扩缩容,使用 EPP 导出的指标(如队列深度)。 - **Workload Variant Autoscaler (WVA)**:全局优化的扩缩容,通过在不同 variant 之间或跨推理池放置副本,在满足延迟目标的同时最小化成本。 参见 Autoscaling 了解完整细节。 ![Advanced llm-d Arch](https://llm-d.ai/img/versioned/0.8/assets/images/llm-d-arch.svg) --- > 文档版本:llm-d 0.8(Docusaurus 文档站,CNCF 托管项目)。llm-d 是 Kubernetes 原生的分布式推理服务栈,使用 vLLM 作为模型服务引擎,Inference Gateway 作为请求调度器与负载均衡器,Kubernetes 作为基础设施编排与控制平面,面向大规模生产环境的 P/D 分离、分布式 KV Cache 与 SLO 感知调度。