# Tair KVCache - 动态分级缓存 - LLM推理缓存 - 数据库 - 阿里云 > **来源**:阿里云 > **作者**:未知 > **发布日期**:2025-09-23 > **原文链接**:https://www.aliyun.com/product/kvcache --- Tair KVCache 为大语言模型推理提供 KVCache 缓存服务,实现 GPU 服务器 HBM、DRAM 等多级存储的池化管理。以存代算,提升大语言模型推理服务的推理速度和吞吐性能,提升 GPU 服务器的资源利用率,加速提效的同时降低资源成本。 ![Tair KVCache](https://img.alicdn.com/imgextra/i4/O1CN01CHqiYg1wjbgWsIZVM_!!6000000006344-2-tps-2320-1224.png) Tair KVCache 通过内存池化与多级缓存管理、智能路由、高效数据传输、分布式服务化支持等能力,显著提升大模型推理性能,适用于多轮对话、海量并发、内容生成和推荐系统等商业场景,全面优化资源利用率和用户体验。 ## 多轮对话场景 Tair KVCache 通过将 KV cache 卸载至分布式池化存储,支持更大批处理规模和更长上下文。Redis 语义接口服务多轮对话缓存,确保对话连贯性。 ![架构图-参考实现](https://img.alicdn.com/imgextra/i2/O1CN01D6FEP31H0ohnBIc8Q_!!6000000000696-2-tps-3040-1448.png) ## 海量并发场景 Tair KVCache 通过其分布式内存池化和多级缓存机制、高效数据传输技术和亲和性路由策略能够有效应对智能驾驶、社交平台等场景下的高并发挑战。 ![架构图-参考实现](https://img.alicdn.com/imgextra/i4/O1CN01YFMrCs1Mjlel8qs9A_!!6000000001471-2-tps-3040-1416.png) ## 知识检索增强(RAG)场景 结合 KVCache 和 RAG 方法,对预检索内容进行缓存优化,通过存储 RAG cache、离线计算结果及优化加载 pipeline,大幅提升响应速度和吞吐量。 ![架构图-参考实现](https://img.alicdn.com/imgextra/i3/O1CN01fimaze1ypDltlfjWz_!!6000000006627-2-tps-3040-1376.png) ## 市场认可 国际市场研究机构 Gartner 日前公布 2025 年度全球《云数据库管理系统魔力象限》报告,阿里云成为亚太区唯一入选该报告"领导者(LEADERS)"象限的科技公司,同时也是唯一一家连续 6 年入选"领导者"象限的中国企业。 ## 安全与可靠性 Tair KVCache 提供网络隔离、权限管理、分布式协同等多种方式维护服务安全稳定。 - **访问控制**:支持通过 RAM 身份管理机制,实现对于控制台或使用 API 访问阿里云账号下的资源的权限控制;支持对实例设置账号密码,管理登录权限。 - **网络安全**:为用户提供专有网络(VPC),帮助用户基于隧道技术实现数据链路层的隔离,为每个用户提供独立隔离的虚拟安全网络环境;支持通过设置白名单和安全组对实例的网络访问源进行安全控制。 - **容灾服务**:提供多个节点,实现分布式部署,单个节点的故障不会影响整个实例的可用性;通过智能路由,管理跨节点协同和通信路径。 (附:查看《安全白皮书》)