- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇) - 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/ - 章节重组为 9 个主题分组并挂接摘要引用
4.3 KiB
llm-d:K8s 原生的分布式推理栈架构文档
来源:llm-d
作者:llm-d 项目团队(CNCF Sandbox 项目)
发布日期:2026-08-06
原文链接:https://llm-d.ai/docs/architecture
Architecture
llm-d 架构高级指南。从这里开始,然后深入阅读具体指南。
Core Components(核心组件)
llm-d 架构围绕三个主要概念构建:Router(路由器)、InferencePool(推理池) 和 Model Server(模型服务器)。
- llm-d Router —— 推理请求的智能入口点。它提供 LLM 感知的负载均衡、请求排队和策略执行。由两个功能部分组成:
- Proxy:一个高性能 L7 代理(通常是 Envoy),接受用户请求,并通过
ext-proc协议咨询 EPP 以确定最佳目标。 - Endpoint Picker (EPP):路由引擎,基于实时指标、KV-cache 亲和性和配置的策略,对模型服务器 Pod 进行评分和选择。
- Proxy:一个高性能 L7 代理(通常是 Envoy),接受用户请求,并通过
- InferencePool —— 通过标签选择器对服务同一基础模型的 Model Server Pod 进行分组的 API。被概念化为"面向 LLM 优化的 Service",是 Router 的发现目标。此外:
- Variant:InferencePool 内 Model Server Pod 的逻辑子分组,通过 Pod 标签而非专用资源来表达。Variant 根据共享特征(如服务角色(例如 prefill 或 decode)、成本概况、性能概况(吞吐量、延迟)或其他运营属性)来区分模型服务器。
- Model Server —— 在硬件加速器(GPU、TPU、HPU)上执行模型的推理引擎(如 vLLM 或 SGLang)。
Advanced Patterns(高级模式)
llm-d 的核心设计可以扩展出可选的高级模式:
KV Cache Management(KV Cache 管理)
llm-d 提供了一个全面的生态系统,用于跨推理池管理和复用 KV cache,包括:
- Prefix-Cache Aware Routing(前缀缓存感知路由):启发式和精确的技术以最大化缓存命中。
- KV-Cache Indexing(KV Cache 索引):跨所有模型服务器对缓存状态进行事件驱动的跟踪。
- KV Offloading(KV 卸载):分层存储体系(CPU、SSD)以扩展缓存容量。
参见 KV Cache Management 了解这些组件如何组合的概述。
Disaggregated Serving(分离式服务)
在分离式服务中,单个推理请求被拆分为多个阶段(例如 Prefill 和 Decode),由专门的 worker 处理。llm-d Router 通过同时选择 prefill 和 decode 端点并协调它们之间的 KV-cache 传输来编排这一流程。
参见 Disaggregation 了解完整细节。
Predicted Latency-Based Routing(基于预测延迟的路由)
llm-d Router 可以通过"consultant"边车扩展,以提供用于路由决策的高级信号。主要实现是 Latency Predictor,它支持基于预测的 ITL 和 TTFT 的路由。
- Latency Predictor:在线训练 XGBoost 模型以预测请求延迟,用于更好的端点评分和 SLO 执行。
Batch Inference(批推理)
批处理和离线推理工作负载由两个模块处理,可以独立或一起部署。Batch Gateway 提供 OpenAI 兼容的 Batch API 用于作业管理,而 Async Processor 通过流控门控分发排队的请求。组合使用时,Batch Gateway 将分发委托给 Async Processor。
参见 Batch Inference 了解批推理设计的细节。
Autoscaling(自动扩缩容)
llm-d 通过两种互补的方法支持主动的、SLO 感知的自动扩缩容:
- HPA/KEDA:标准 Kubernetes 原生扩缩容,使用 EPP 导出的指标(如队列深度)。
- Workload Variant Autoscaler (WVA):全局优化的扩缩容,通过在不同 variant 之间或跨推理池放置副本,在满足延迟目标的同时最小化成本。
参见 Autoscaling 了解完整细节。
文档版本:llm-d 0.8(Docusaurus 文档站,CNCF 托管项目)。llm-d 是 Kubernetes 原生的分布式推理服务栈,使用 vLLM 作为模型服务引擎,Inference Gateway 作为请求调度器与负载均衡器,Kubernetes 作为基础设施编排与控制平面,面向大规模生产环境的 P/D 分离、分布式 KV Cache 与 SLO 感知调度。