文档(金鹏): 2026-08-06 章节 48 篇文章摘要归档
- 46 篇原文+摘要双文件归档(按 来源/作者 分层,复用本地归档 20 篇+新抓取 26 篇) - 即梦生成 9 组主题配图(大图+列表缩略图)存入 知识/金鹏/20260806/ - 章节重组为 9 个主题分组并挂接摘要引用
This commit is contained in:
@@ -0,0 +1,219 @@
|
||||
# 下一代推理优化技术:高性能网络驱动的PD分离与KV Cache Offload测试(上)
|
||||
|
||||
> **来源**:超擎数智(官网博客)
|
||||
> **作者**:超擎数智
|
||||
> **发布日期**:2026-08-05(原文未标注,按下载日期)
|
||||
> **原文链接**:https://chaoqing-i.com/blog/next-gen-inference-optimization-pd-separation-kv-cache-offload-test
|
||||
|
||||
---
|
||||
|
||||
近年来,大规模模型在各类应用场景中快速落地,带动了推理需求的高速增长。随着模型参数量不断提升和用户请求并发数持续攀升,如何提升推理性能成为业界关注的核心问题,在众多优化方向中,PD分离与KV Cache Offload被认为是当前对推理性能提升最具突破性的两项关键技术,前者通过计算与通信解耦,实现更高效的资源利用,后者则通过缓存卸载,极大降低了显存占用并提升大模型长文本推理的效率。
|
||||
|
||||
为全面验证高性能网络与PD分离、KV Cache Offload这两项技术的性能优势与应用价值,**NVIDIA、超擎数智、联想、DaoCloud、纳多德五家公司联合投入总计数千万元的设备与资源,在超擎数智高性能计算和人工智能研发测试中心开展跨厂商协作测试。**本次测试旨在为业界提供权威的技术验证结果,探索推理优化的最佳实践,并为未来的大规模部署提供参考。
|
||||
|
||||
在大模型推理场景中,传统架构面临两大挑战:
|
||||
|
||||
- 计算效率瓶颈:传统的一体化部署模式中Prefill和Decode在同一设备上执行会出现严重的资源竞争问题,两个阶段的资源需求特性无法得到针对性优化导致计算资源利用率低。
|
||||
- 显存带宽压力:KV Cache的显存开销随上下文长度增长线性膨胀,显存带宽成为性能瓶颈。
|
||||
|
||||
**PD分离(Prefill & Decode Separation)与KV Cache Offload是当前大模型推理中的核心优化技术,可显著提升推理吞吐和并发能力:**
|
||||
|
||||
- **提升推理效率、降低延迟:**通过拆分Prefill和Decode阶段并部署到不同设备,避免计算资源冲突,使推理**Token延迟显著降低、Token吞吐提升 2~3 倍。**
|
||||
- **显著降低显存占用、支持更多用户并发:**KV Cache Offload将大量上下文缓存从显存转移至CPU/SSD,大幅节省GPU显存,使同一模型能够支持更多并发用户或更长的上下文长度。
|
||||
- **提高资源利用率、降低成本:**PD分离+Offload让高性能GPU更专注在重计算任务上,普通硬件即可承担缓存任务,整体推理集群性价比提升明显。
|
||||
|
||||
## PD分离与KV Cache Offload技术介绍
|
||||
|
||||
### 1. 什么是PD分离?为什么要选择PD分离?
|
||||
|
||||
在大语言模型(LLM)的推理过程中,通常会经历两个阶段:
|
||||
|
||||
**1)Prefill阶段(输入处理)**
|
||||
|
||||
a. 模型一次性读取并并行处理全部输入Token,建立上下文理解
|
||||
b. 计算模式:高并行度的矩阵乘法,计算密集,显存占用相对较低
|
||||
c. 特点:更适合高吞吐量的GPU、多卡并行运行
|
||||
|
||||
**2)Decode阶段(输出生成)**
|
||||
|
||||
a. 模型基于上下文(以及 KV Cache)逐个生成Token
|
||||
b. 计算模式:顺序生成,一个Token接一个Token,延迟敏感
|
||||
c. 显存占用:会随着上下文长度增长而迅速增加(因为要存KV Cache)
|
||||
|
||||
在传统部署中,这两个阶段通常运行在同一批GPU上。但问题是Prefill和Decode的资源需求完全不同——一个追求高并行算力,一个追求低延迟和大显存。把它们混在同一批GPU上跑,往往两边性能都打折扣。
|
||||
|
||||
**PD分离(Prefill–Decode Separation)**
|
||||
|
||||
顾名思义,就是把Prefill和Decode分开部署在不同的硬件资源池中:
|
||||
|
||||
- Prefill阶段使用高算力、高吞吐的GPU
|
||||
- Decode阶段使用显存更大、延迟更低的GPU
|
||||
|
||||
这样做的好处:
|
||||
|
||||
- 针对性优化:让每个阶段用最合适的硬件,发挥最佳性能
|
||||
- 资源独立扩展:Prefill和Decode各自可以根据负载独立增加或减少GPU
|
||||
- 提升整体吞吐量:避免一种任务拖慢另一种任务
|
||||
|
||||
**PD分离的挑战**
|
||||
|
||||
- 额外的通信开销:如果Prefill和Decode放在不同的GPU上,需要传输KV Cache,网络延迟和带宽会成为瓶颈。
|
||||
- 调度复杂度增加:系统要实时协调两列任务的分配,否则Decode阶段可能会空等Prefill的结果,或者Prefill资源被Decode阻塞。
|
||||
- 实现复杂:框架和任务调度器需要支持流水线,KV Cache输出,异步执行等操作,难度要比单机单卡推理更难维护。
|
||||
- 内存占用高:Prefill阶段可能会同时处理多个请求,Decode阶段需要保留全部的KV Cache,内存压力会很大。
|
||||
|
||||
PD分离就是"分工合作",让Prefill和Decode各自使用最适合的GPU,从而提升效率和吞吐量,但也需要解决通信、调度、内存等方面的挑战。
|
||||
|
||||
### 2. 什么是KV Cache?为什么我们要offload?
|
||||
|
||||
如果把大语言模型(LLM)比作一个写小说的作家,那么Transformer就是他的"思考方法"。
|
||||
|
||||
作家写故事时,会一边看之前写的内容,一边决定接下来写什么。同样,Transformer 在生成文本时,也是一边参考之前生成的Token,一边预测下一个Token。
|
||||
|
||||
**从Transformer说起**
|
||||
|
||||
在Transformer的自注意力(Self-Attention)机制里,每个Token(可以理解为一个词或字的编码)都会生成三种向量:
|
||||
|
||||
- Q(Query):我现在要找的信息是什么?
|
||||
- K(Key):我是谁?(特征坐标)
|
||||
- V(Value):我带来的内容是什么?(特征内容)
|
||||
|
||||
在Transformer生成文本时,每次只会生成一个新Token,模型会用这个Token的Q去和所有历史Token的K做匹配,找到相关性,然后用这些相关的V计算输出,但是标准Transformer在推理时是逐个Token生成的,比如:
|
||||
|
||||
输入:"我想要读一"
|
||||
生成:"我想要读一本"
|
||||
继续生成:"我想要读一本书"
|
||||
|
||||
但在生成第三个Token时,它又会重新计算前面所有Token的K和V,哪怕这些数据早就算过了!
|
||||
|
||||
这种重复计算会导致推理的计算量随着Token数量呈二次方增长,速度很慢。
|
||||
|
||||
**KV Cache的核心宗旨"别重复干活"**
|
||||
|
||||
KV Cache的核心思想是:历史的K和V早就算好了,直接存起来,别每次都重算。
|
||||
|
||||
这样,每次生成新Token时,只需:
|
||||
|
||||
- 计算新Token的K和V
|
||||
- 把它们拼到之前缓存的结果中
|
||||
- 用缓存+新Token一起继续生成
|
||||
|
||||
这样一来,推理的计算量就从二次方降到线性,大大加快速度。
|
||||
|
||||
**为什么要Offload**
|
||||
|
||||
KV Cache虽然能加速,但它有个副作用:特别占显存。
|
||||
|
||||
举个例子:
|
||||
|
||||
- 假设你的模型上下文长度是8万个Token
|
||||
- 每个Token的K和V都要存
|
||||
- 可能光KV Cache就能占用几十GB的显存
|
||||
|
||||
显存是GPU上最宝贵的资源,除了KV Cache,还需要存模型权重、中间计算结果等。如果显存被占满,推理就会崩溃或者无法运行。
|
||||
|
||||
**Offload 的作用**
|
||||
|
||||
Offload就是把一部分数据从显存(GPU Memory)挪到其他存储介质,比如:
|
||||
|
||||
- CPU内存(RAM):容量大,但带宽比GPU慢
|
||||
- SSD:容量更大,但速度更慢
|
||||
- 高带宽内存(HBM):速度快,但昂贵且容量有限
|
||||
|
||||
在KV Cache场景下,Offload的好处是:
|
||||
|
||||
- 把暂时用不到的历史KV数据移到CPU/SSD
|
||||
- 腾出GPU显存,保证当前推理不卡
|
||||
- 在需要时再把数据搬回来(当然搬运有代价,所以要权衡速度和显存占用)
|
||||
|
||||
## 联合测试概述
|
||||
|
||||
### 1. 测试目标
|
||||
|
||||
验证PD分离和KV Cache Offload在大模型推理场景下的性能优化效果,具体包括:
|
||||
|
||||
- 降低端到端延迟:解耦Prefill与Decode阶段,减少资源争抢。
|
||||
- 扩展上下文长度:通过KV Cache分层存储(显存→主机内存/NVMe),突破显存容量限制。
|
||||
- 提升硬件利用率:优化计算单元和存储介质的协作效率。
|
||||
|
||||
### 2. 测试拓扑与环境
|
||||
|
||||
测试拓扑见图1,环境信息如下:
|
||||
|
||||
- **H20服务器 ×1**:超擎数智元景系列AI服务器CQ7688-L,搭载 NVIDIA H20 GPU,8U8卡 NVLink,8U空间内搭载1块NVIDIA Hopper架构HGX-8GPU模组,系统支持4.0Tbps网络带宽,满足万亿级参数超大模型并行训练需求。
|
||||
- **L20服务器 ×3**:超擎数智擎天系列L20 AI 服务器CQ7458-L(4U8卡 PCIe)支持4卡或8卡配置,用户可以基于应用模型按需配置/灵活切换,并且支持丰富的AI加速卡和智能网卡,从而适应不同人工智能场景的需求,满足各种 AI 业务场景下的应用需求。
|
||||
- **RoCE交换机 ×6**:采用NVIDIA Spectrum™ SN5000系列第五代Spectrum以太网交换机,计算网络和存储网络均采用SN5600进行组网。
|
||||
- **存储服务器**:采用联想问天WR5220 G3高性能存储服务器。
|
||||
- **软件平台**:采用DaoCloud d.run平台。
|
||||
- **光连接器件**:采用纳多德高性能光模块和光纤跳线,保障性能和稳定性的同时可以大幅度降低成本。
|
||||
- **存储节点 ×3**:采用3台分布式存储节点,每台节点均搭配NVMe硬盘。
|
||||
|
||||
关键组件如下:
|
||||
|
||||
- **Prefill单元**:部署在1台高算力H20 GPU(高速PCIe 5.0/NVLink)上,充分利用强大算力,专注生成初始KV Cache。
|
||||
- **Decode单元**:使用3台L20 GPU,专注于GPU执行自回归生成。
|
||||
- **存储层级**:
|
||||
- 显存(HBM):存储活跃KV Cache(热数据)。
|
||||
- 主机内存(DDR):卸载历史KV Cache(温数据)。
|
||||
- NVMe SSD:硬盘存储极低频访问的KV Cache(冷数据)。
|
||||
- **网络连接**:H20和L20 400G计算网络、H20、L20、StorageNode 200G存储网络分别使用不同的高速交换机互联传输数据。
|
||||
|
||||
### 3. 测试设计
|
||||
|
||||
**3.1 PD分离测试**
|
||||
|
||||
- 对照组:传统耦合架构(Prefill与Decode共享H20 GPU)。
|
||||
- 实验组:PD分离架构(Prefill由H20 GPU处理,Decode由L20 GPU处理)。
|
||||
- 指标:
|
||||
- Prefill延迟:从输入Prompt到生成首个Token的时间。
|
||||
- Decode吞吐量:Tokens/Second(TPS)。
|
||||
- GPU利用率:nvidia-smi监控计算负载。
|
||||
|
||||
**3.2 KV Cache Offload测试**
|
||||
|
||||
- 对照组:全量KV Cache驻留显存。
|
||||
- 实验组:分层卸载策略(显存→内存→SSD)。
|
||||
- 指标:
|
||||
- 显存占用峰值:dcgm记录HBM使用量。
|
||||
- Offload延迟:冷数据加载至显存的平均耗时。
|
||||
- 最大支持上下文:通过逐步增加Prompt长度测试崩溃点。
|
||||
|
||||
**3.3 联合测试**
|
||||
|
||||
验证PD分离与Offload协同效果:
|
||||
|
||||
- 场景:8K上下文 + 100轮对话。
|
||||
- 关键指标:端到端延迟、系统总功耗。
|
||||
|
||||
### 4. 预期结果
|
||||
|
||||
**4.1 PD分离**
|
||||
|
||||
预期结果:
|
||||
|
||||
- Decode阶段延迟降低30%-50%(L20 GPU处理避免H20 GPU阻塞)。
|
||||
- H20 GPU利用率从60%提升至85%(专注计算密集型Prefill)。
|
||||
|
||||
**4.2 KV Cache Offload**
|
||||
|
||||
预期结果:
|
||||
|
||||
- 显存占用减少60%(8K上下文下从16GB→6.4GB)。
|
||||
- 支持上下文长度从2K扩展至16K。
|
||||
|
||||
**4.3 联合优化**
|
||||
|
||||
预期结果:
|
||||
|
||||
- 系统总吞吐量(QPS)提升2倍,功耗降低20%。
|
||||
|
||||
### 5. 数据收集与分析
|
||||
|
||||
- 工具:
|
||||
- 性能分析:Nsight Systems、perf。
|
||||
- 资源监控:Prometheus(GPU/CPU/内存指标)。
|
||||
- 分析方法:
|
||||
- 对比对照组/实验组的延迟分布。
|
||||
- 显存带宽与计算效率的相关性分析。
|
||||
|
||||
> **注**:本文为系列文章"上"篇,主要介绍技术背景、测试方案设计与预期结果;实测数据与分析拟在"下"篇呈现。
|
||||
@@ -0,0 +1,81 @@
|
||||
# 📊 文章摘要:下一代推理优化技术:高性能网络驱动的PD分离与KV Cache Offload测试(上)
|
||||
|
||||
> **原文**:[2026-08-05_下一代推理优化技术_高性能网络驱动的PD分离与KV_Cache_Offload测试_上.md](./2026-08-05_下一代推理优化技术_高性能网络驱动的PD分离与KV_Cache_Offload测试_上.md)
|
||||
> **原文链接**:https://chaoqing-i.com/blog/next-gen-inference-optimization-pd-separation-kv-cache-offload-test
|
||||
> **来源**:超擎数智(官网博客)
|
||||
> **作者**:超擎数智
|
||||
> **发布日期**:2026-08-05
|
||||
> **摘要日期**:2026-08-06
|
||||
> **价值评级**:⭐⭐⭐ 高
|
||||
|
||||
---
|
||||
|
||||
## 核心命题
|
||||
|
||||
> **PD分离验证方案** — 为业界提供一份可直接复用的"PD分离+KV Cache Offload"跨厂商联合测试设计模板(拓扑、对照实验、指标、分层卸载),并系统梳理两项技术带来的性能收益与工程代价。
|
||||
|
||||
---
|
||||
|
||||
## 文章概要
|
||||
|
||||
本文是"下一代推理优化技术"系列的上篇,由 NVIDIA、超擎数智、联想、DaoCloud、纳多德五家厂商联合投入数千万元设备,在超擎数智研发测试中心开展 PD 分离与 KV Cache Offload 的跨厂商验证测试。文章先以科普方式解释 Prefill/Decode 两阶段的计算特征差异、KV Cache 原理与卸载动因,再给出完整测试方案:H20 承担 Prefill、3 台 L20 承担 Decode、显存/内存/NVMe 三级存储分层,并设计了对照实验与预期指标(Token 吞吐提升 2~3 倍、显存占用减少 60%、QPS 提升 2 倍)。其价值在于测试方法论的完整呈现与对工程代价的清醒说明,但本文不含任何实测数据,认知增量有限,需以下篇实测为准。
|
||||
|
||||
---
|
||||
|
||||
## 关键要点
|
||||
|
||||
1. **PD分离=两阶段分工** — 将计算密集的 Prefill 与访存密集的 Decode 分离部署到不同硬件池,针对性优化、独立扩缩容、提升整体吞吐;但引入通信开销、调度复杂度、实现复杂、内存占用四类代价。`[分类: 共识]`
|
||||
2. **KV Cache Offload 缓解显存墙** — 将历史 KV 按热/温/冷分层卸载至 HBM→DDR→NVMe,突破显存容量限制,代价是数据搬运动态权衡速度与容量。`[分类: 共识]`
|
||||
3. **跨厂商联合测试模板** — 1 台 H20(Prefill)+ 3 台 L20(Decode)+ 3 台 NVMe 分布式存储节点 + 400G/200G RoCE 组网,对照组/实验组对比设计,指标覆盖 Prefill 延迟、Decode TPS、GPU 利用率、显存峰值、Offload 延迟与最大上下文。`[分类: 共识]`
|
||||
4. **预期收益量化** — 预期 Decode 延迟降 30%-50%、H20 利用率从 60% 升至 85%、显存占用减 60%(16GB→6.4GB)、上下文 2K→16K、联合场景 QPS 提升 2 倍且功耗降 20%。`[分类: 争议]`(预期值未经实测验证,是本文主要悬念)
|
||||
5. **网络是PD分离的隐性前提** — 计算网络与存储网络分离组网(400G/200G),暗示 KV 传输带宽与存储链路带宽是分离架构能否兑现收益的关键变量。`[分类: 未探索方向]`
|
||||
|
||||
---
|
||||
|
||||
## 批判性分析
|
||||
|
||||
### 假设前提
|
||||
|
||||
作者假设 PD 分离与 KV Cache Offload 的收益(吞吐提升、显存释放)在跨厂商、跨硬件组合下依然成立,且高性能网络(400G/200G RoCE)可充分承载 KV 传输开销;同时假设测试环境能代表真实生产负载(8K 上下文+100 轮对话场景相对温和)。
|
||||
|
||||
### 论据与逻辑
|
||||
|
||||
本文论据链不完整——所有收益均为"预期结果"而非测量结果,逻辑停留在方案推演层面,无法支撑"最具突破性"的定性判断;文章对挑战的论述(通信开销、调度复杂度)反而削弱了自身乐观基调,说明作者对代价有认知,但预期收益如何抵消代价缺乏论证。
|
||||
|
||||
### 边界与局限
|
||||
|
||||
结论适用范围待下篇数据确认;测试采用单一模型规模与有限并发场景,不覆盖超长上下文(百万级)、多租户混合负载等极端情况;五厂商联合测试由利益相关方组织,需关注数据独立性;PD 分离在短序列、低频请求场景下未必优于融合部署(本文未讨论此对照)。
|
||||
|
||||
---
|
||||
|
||||
## 可引用金句
|
||||
|
||||
> "PD分离就是'分工合作',让Prefill和Decode各自使用最适合的GPU,从而提升效率和吞吐量,但也需要解决通信、调度、内存等方面的挑战。"
|
||||
|
||||
> "KV Cache的核心思想是:历史的K和V早就算好了,直接存起来,别每次都重算。"
|
||||
|
||||
> "在需要时再把数据搬回来(当然搬运有代价,所以要权衡速度和显存占用)。"
|
||||
|
||||
---
|
||||
|
||||
## 总体评价
|
||||
|
||||
**亮点**:
|
||||
- 测试方案完整可复用:拓扑、对照实验设计、指标选取、三级存储卸载策略,可作为团队自建 PD 分离验证的起步模板
|
||||
- 对 PD 分离四类代价(通信/调度/实现/内存)的梳理比多数营销稿坦诚
|
||||
- 五厂商跨生态(NVIDIA+联想+DaoCloud+纳多德)联合验证,反映产业协同趋势
|
||||
|
||||
**不足**:
|
||||
- 全文无任何实测数据,全部为预期值,"2~3 倍/60%/2 倍"等数字暂不可信
|
||||
- 技术科普部分为共识性内容,无新观点;系列"上"篇性质决定了本文认知增量有限
|
||||
- 未讨论 PD 分离的适用边界(短序列场景融合部署可能更优)
|
||||
|
||||
**适用场景**:需要快速理解 PD 分离与 KV Cache Offload 原理、并计划设计类似验证实验的推理平台团队、智算中心运维与选型人员;也适合作为 PD 分离专题的入门阅读材料。
|
||||
|
||||
**关联建议**:待"下篇"实测数据发布后对照阅读;与《异构智算中心分布式PD分离推理技术的探索与实践》(中国电信 OTN 广域试验)、《LLM推理成本直降60%:PD分离在大模型商业化中的关键价值》(方案选型框架)联读可构成"原理→方案→实测"完整链条。
|
||||
|
||||
---
|
||||
|
||||
## 配图
|
||||
|
||||

|
||||
@@ -0,0 +1,102 @@
|
||||
# ODCC AI存储实验室KV Cache评测再发布:英韧N3X以硬核SSD性能筑牢AI推理引擎
|
||||
|
||||
> **来源**:超擎数智
|
||||
> **作者**:未知
|
||||
> **发布日期**:2026-08-06
|
||||
> **原文链接**:https://chaoqing-i.com/blog/odcc-ai-storage-lab-kv-cache-evaluation-innogrit-n3x-ssd
|
||||
|
||||
---
|
||||
|
||||
随着大模型发展全面迈入规模化推理部署的新阶段,推理性能、成本控制与资源利用率,正在成为智算基础设施建设的核心命题。在这一过程中,存储已不再只是数据承载的底层资源,而是影响GPU利用率、推理延迟与系统吞吐的关键变量。
|
||||
|
||||
ODCC AI存储实验室作为面向AI基础设施前沿技术验证的重要平台,依托超擎数智高性能算网环境与全栈技术服务能力,聚焦先进存算分离架构,持续开展面向AI训练、推理、存储部件与系统协同的实证测试,为行业关键技术选型与系统优化提供可量化、可复用的参考依据。
|
||||
|
||||
继ODCC AI存储实验室发布焱融YRCache推理存储系统KV Cache评测成果后,本次将进一步聚焦测试中的核心存储硬件——英韧科技洞庭-N3X,一款面向AI场景打造的企业级SSD产品。在KV Cache从GPU显存向外部存储卸载的过程中,高性能SSD正从传统意义上的"存储介质",跃升为影响推理流水线效率的重要引擎。
|
||||
|
||||
当大模型上下文窗口持续向百万级演进,KV Cache规模急剧膨胀,GPU的HBM容量不足已成为高并发、长上下文推理场景下的典型瓶颈。此时,外部存储系统是否能够以足够低的延迟、足够高的带宽和足够稳定的IOPS响应KV Cache读写请求,直接影响首Token延迟、单Token输出时间以及GPU整体利用率。
|
||||
|
||||
在本次ODCC AI存储实验室的KV Cache专项测试中,英韧洞庭-N3X凭借卓越的单盘性能,为存储系统实现推理提速、长上下文支撑与成本优化提供了坚实的硬件底座。
|
||||
|
||||
## 1、构建KV Cache全栈验证环境
|
||||
|
||||
本次专项测试,超擎数智在ODCC AI存储实验室中提供了贴近真实智算中心部署场景的基础设施环境,包括高性能GPU服务器、分布式存储集群、高速网络拓扑以及面向大模型推理任务的系统测试平台。通过这一环境,实验室能够从"部件—系统—应用"多个维度,对AI推理存储方案进行端到端评估。
|
||||
|
||||
本次,英韧科技洞庭-N3X承担了存储集群的核心硬件支撑任务。作为面向AI场景打造的企业级SSD产品,洞庭-N3X采用PCIe Gen5接口与优化的数据引擎,围绕高带宽、低延迟、高并发、稳态输出等关键能力进行设计,目标直指大模型训练与推理过程中的"内存墙"问题。
|
||||
|
||||
在KV Cache卸载场景中,SSD不再只是冷数据的仓库,而是持续参与推理数据流转的高频访问介质。其性能水平将直接决定GPU能否持续获得数据供给,进而影响整个推理系统是否能够保持高吞吐、低延迟运行。
|
||||
|
||||

|
||||
|
||||
## 2、单盘性能硬核突破,为KV Cache高效流转提供物理基础
|
||||
|
||||
KV Cache读写具有典型的高并发、高随机、小I/O访问特征,同时在缓存预加载、批量迁移、长上下文处理等场景下,也对顺序带宽提出了极高要求。ODCC AI存储实验室测试结果显示,英韧洞庭-N3X在顺序带宽、随机IOPS以及稳态输出能力上均展现出突出的单盘性能优势。
|
||||
|
||||
**14GB/s顺序带宽 支撑存储系统高效数据迁移**
|
||||
|
||||
在需要预加载KV Cache或进行批量缓存数据迁移的场景中,顺序带宽直接决定数据搬运效率。测试显示,英韧洞庭-N3X顺序读速度达到14GB/s,顺序写速度逼近12GB/s,充分释放PCIe Gen5接口的传输潜力。
|
||||
|
||||
对于AI推理系统而言,这意味着在大规模长上下文任务启动、缓存批量加载或跨节点数据迁移过程中,底层SSD能够为上层存储系统提供更高效的数据供给能力,减少数据准备时间,提升整体推理链路的响应效率。
|
||||
|
||||

|
||||
|
||||
**稳态随机读写超千万IOPS 让存储系统持久输出**
|
||||
|
||||
KV Cache在推理阶段的访问模式并非单纯的大块顺序读写,而是大量并发随机小I/O请求。尤其在多用户并发、长上下文复用、缓存命中与卸载回读场景中,SSD的随机读写性能与稳态表现尤为关键。
|
||||
|
||||
在基准测试中,英韧洞庭-N3X的4KB随机读性能接近3500K IOPS,4KB随机写性能达到756.72K IOPS,均高于标称性能。凭借全盘稳态下的持续IOPS输出能力,搭载N3X的存储系统在整个评测过程中保持稳定运行,能够持续高效响应KV Cache读写请求。
|
||||
|
||||
这也进一步说明,在AI推理存储架构中,企业级SSD的价值不仅体现在峰值性能,更体现在长时间高负载运行下的稳定输出能力。对于真实智算中心而言,这一能力直接关系到系统服务质量与推理任务的稳定性。
|
||||
|
||||

|
||||
|
||||
## 3、从单盘到系统:高性能SSD放大KV Cache卸载收益
|
||||
|
||||
ODCC AI存储实验室KV Cache专项测试并未停留在单盘基准层面,而是进一步将英韧洞庭-N3X纳入真实推理系统链路,与推理存储系统、高速网络和GPU服务器进行联合验证。
|
||||
|
||||
测试结果显示,N3X的单盘性能优势能够有效转化为系统级收益,在延迟、吞吐、GPU利用率与成本结构等方面形成显著提升。
|
||||
|
||||
**微秒级尾延迟,为存储系统提供"零等待"基础**
|
||||
|
||||
在大模型推理过程中,Decode阶段需要持续访问与更新KV Cache。此时,存储路径的尾延迟将直接影响Token生成的连续性与稳定性。
|
||||
|
||||
本次测试显示,在采用高端GPU的服务器节点上,英韧洞庭-N3X实现了低至66μs的P99延迟,写入延迟稳定控制在微秒级。得益于这一低延迟能力,搭载N3X的存储系统在KV Cache卸载场景中能够实现近乎"零感知"的数据写入与读取支撑,使GPU在执行推理任务时尽可能减少因数据等待造成的空转。
|
||||
|
||||

|
||||
|
||||
对于上层应用而言,这意味着长文本生成、多轮对话、代码生成、文档分析等场景能够获得更流畅的生成体验;对于智算中心而言,则意味着GPU资源能够被更充分利用,单位算力投入产出比进一步提升。
|
||||
|
||||
**吞吐量显著提升,中端GPU推理效能接近高端**
|
||||
|
||||
在长上下文和高并发任务中,GPU显存容量往往成为限制吞吐提升的关键因素。当KV Cache能够通过高性能存储系统实现高效卸载后,GPU显存压力得到释放,推理并发能力与吞吐表现随之显著提升。
|
||||
|
||||
测试结果显示,在输入长度大于等于10K Token的场景下,基于英韧洞庭-N3X的存储系统使首Token延迟从秒级降至毫秒级;在特定缓存命中场景下,加速比可达百倍。吞吐量方面,中端GPU服务器提升约20倍,高端GPU服务器提升约12倍。
|
||||
|
||||

|
||||
|
||||
这一结果具有重要产业价值。它表明,通过高性能SSD与推理存储系统的协同优化,高性价比的中端GPU也能够在部分长上下文推理场景中展现出接近高端GPU的系统级效能。
|
||||
|
||||
对于正在建设或扩容智算中心的企业而言,这为基础设施选型提供了新的思路:推理性能的提升不再只能依赖单向堆叠高端GPU,也可以通过"以存强算"的系统架构创新,释放中端算力资源潜能,从而实现更优的成本结构。
|
||||
|
||||
**存储与网络协同,高速算网进一步放大卸载收益**
|
||||
|
||||
本次测试还围绕不同网络带宽环境下的KV Cache卸载效果进行了对比分析。结果显示,在存储池能够满足网络带宽需求的前提下,网络带宽越高,推理吞吐量提升越显著。
|
||||
|
||||
针对中端GPU服务器,当网络从400G进一步提升至800G乃至1.6T时,KV Cache卸载的加速效果呈增长态势。高速网络与英韧洞庭-N3X的高读写性能形成协同,使PD阶段的数据流转效率持续提升,进一步减少数据搬运对GPU推理任务的影响。
|
||||
|
||||

|
||||
|
||||
## 4、软硬协同验证路径,推动AI存储从部件走向系统标准
|
||||
|
||||
本次ODCC AI存储实验室KV Cache测试,联合焱融YRCache推理存储系统与英韧洞庭-N3X企业级SSD,实现了从存储软件到硬件底层的深度协同验证。
|
||||
|
||||
从测试结果来看,YRCache通过多级KV缓存架构,有效调度GPU显存、主机内存、本地NVMe SSD以及分布式文件存储,突破单一显存容量边界;**英韧洞庭-N3X则以高带宽、低延迟、高IOPS与稳态输出能力,为KV Cache卸载提供坚实的硬件基础。** 二者协同,使存储系统真正进入AI推理主路径,成为释放算力、降低成本、提升并发的关键支点。
|
||||
|
||||
更重要的是,本次测试再次体现了超擎数智在ODCC AI存储实验室中测试环境与测试服务的专业。依托超擎数智在"存储-算力-网络"方面的综合能力,能围绕AI基础设施中的关键瓶颈问题,组织产业链上下游开展真实环境下的联合验证。
|
||||
|
||||
这不仅为存储场景的关键部件选型提供了数据依据,也为智算中心在AI推理场景下构建高性价比、高效率、高稳定性的系统架构提供了实践参考。
|
||||
|
||||
## 5、以存强算,超擎数智携手生态伙伴共建AI基础设施新范式
|
||||
|
||||
随着大模型推理规模持续扩大,KV Cache的存储与管理正在成为AI基础设施架构演进中的核心议题。超擎数智将持续发挥高性能算网环境与全栈技术服务能力,围绕KV Cache、AI存储系统、企业级SSD、高速网络、GPU集群等关键方向,推进"部件—系统—应用"的全链路协同测试。
|
||||
|
||||
本次英韧洞庭-N3X的测试结果表明,高性能SSD正在成为AI推理时代不可或缺的关键支撑。未来,ODCC AI存储实验室将继续携手更多产业生态伙伴,以系统化测试、标准化评估和实证化数据,助力AI存储技术加速成熟,推动智算基础设施从"以算为中心"走向"存算协同、以存强算"的新阶段。
|
||||
@@ -0,0 +1,82 @@
|
||||
# 📊 文章摘要:ODCC AI存储实验室KV Cache评测再发布:英韧N3X以硬核SSD性能筑牢AI推理引擎
|
||||
|
||||
> **原文**:[2026-08-06_ODCC_AI存储实验室KV_Cache评测再发布_英韧N3X以硬核SSD性能筑牢AI推理引擎.md](./2026-08-06_ODCC_AI存储实验室KV_Cache评测再发布_英韧N3X以硬核SSD性能筑牢AI推理引擎.md)
|
||||
> **原文链接**:https://chaoqing-i.com/blog/odcc-ai-storage-lab-kv-cache-evaluation-innogrit-n3x-ssd
|
||||
> **来源**:超擎数智
|
||||
> **作者**:未知
|
||||
> **发布日期**:2026-08-06
|
||||
> **摘要日期**:2026-08-06
|
||||
> **价值评级**:⭐⭐⭐ 高
|
||||
|
||||
---
|
||||
|
||||
## 核心命题
|
||||
|
||||
> **以存强算** — 在 KV Cache 卸载场景中,高性能企业级 SSD(英韧洞庭-N3X)从"存储介质"跃升为推理流水线关键引擎,以存储系统优化释放中端 GPU 算力潜能,为智算中心选型提供"以存强算"的新思路。
|
||||
|
||||
---
|
||||
|
||||
## 文章概要
|
||||
|
||||
本文报道 ODCC AI 存储实验室基于超擎数智算网环境、联合焱融 YRCache 推理存储系统与英韧科技洞庭-N3X 企业级 SSD 的 KV Cache 专项评测。评测数据显示:N3X 顺序读 14GB/s、顺序写约 12GB/s,4K 随机读近 3500K IOPS、随机写 756.72K IOPS,P99 延迟低至 66μs;系统级验证中,输入 ≥10K Token 场景下首 Token 延迟从秒级降至毫秒级,中端 GPU 吞吐提升约 20 倍、高端提升约 12 倍,且网络从 400G 升至 1.6T 时卸载加速效果持续增长。文章的核心贡献是给出 KV Cache 卸载场景下 SSD 的关键选型指标(顺序带宽/随机 IOPS/稳态输出/尾延迟),并提出"以存强算"替代单向堆叠高端 GPU 的架构思路;但评测由利益相关方组织,数据口径需批判看待。
|
||||
|
||||
---
|
||||
|
||||
## 关键要点
|
||||
|
||||
1. **SSD进入推理主路径** — KV Cache 卸载场景下 SSD 不再是冷数据仓库,而是持续参与数据流转的高频访问介质,其性能直接决定 GPU 能否获得持续数据供给。`[分类: 共识]`
|
||||
2. **KV Cache负载特征倒逼存储选型** — KV Cache 读写呈高并发、高随机、小 I/O 特征,同时预加载/批量迁移/长上下文场景要求高顺序带宽,因此四维指标(顺序带宽、随机 IOPS、稳态输出、尾延迟)决定卸载收益。`[分类: 共识]`
|
||||
3. **单盘性能实证** — N3X 顺序读 14GB/s、写约 12GB/s(PCIe Gen5),4K 随机读近 3500K IOPS、随机写 756.72K IOPS,P99 延迟 66μs 且全盘稳态持续输出。`[分类: 争议]`(数据由利益相关方实验室发布,未见第三方复核)
|
||||
4. **系统级收益放大** — ≥10K Token 场景首 Token 延迟秒级→毫秒级,特定缓存命中场景加速比可达百倍;中端 GPU 吞吐提升约 20 倍、高端约 12 倍,表明中端 GPU 在长上下文场景可接近高端 GPU 效能。`[分类: 争议]`
|
||||
5. **网络带宽与存储协同放大卸载收益** — 存储池带宽满足前提下,网络从 400G 提升至 800G/1.6T 时卸载加速效果呈增长态势,提示"存储+网络"需联合规划。`[分类: 未探索方向]`
|
||||
6. **"以存强算"的选型新思路** — 推理性能提升不再只能靠堆高端 GPU,可通过存储系统优化释放中端算力潜能,实现更优成本结构。`[分类: 范式突破]`
|
||||
|
||||
---
|
||||
|
||||
## 批判性分析
|
||||
|
||||
### 假设前提
|
||||
|
||||
作者假设外部存储(SSD)的延迟与带宽足以承载 Decode 阶段高频 KV Cache 读写而不拖累 GPU,且评测环境(高端 GPU 节点、特定网络)可代表真实智算中心;"20 倍/12 倍/百倍"数字建立在特定缓存命中场景与 ≥10K Token 长上下文前提之上。
|
||||
|
||||
### 论据与逻辑
|
||||
|
||||
单盘基准数据详实(带宽/IOPS/延迟均有具体数值),支撑"N3X 单盘性能强"的结论;但系统级结论(吞吐提升 20 倍/12 倍)只给出结果未给出对照条件(与什么基线对比、存储命中率、GPU 型号、并发规模),且评测主体——ODCC AI 存储实验室依托超擎数智环境、评测对象英韧为生态合作伙伴、文章由超擎发布,三重利益相关使证据独立性打折,论证链条存在"以单盘性能替代系统收益"的跳跃。
|
||||
|
||||
### 边界与局限
|
||||
|
||||
结论适用于"长上下文(≥10K Token)+ KV Cache 卸载 + 存储池带宽充足"场景,短上下文或显存充裕场景收益递减;"以存强算"仅论证了可行性与部分收益,未量化对比"存储系统投入 vs 高端 GPU 差价"的经济性;首 Token 延迟"秒级降至毫秒级""百倍加速"为特定缓存命中场景口径,不可泛化为一般推理负载。
|
||||
|
||||
---
|
||||
|
||||
## 可引用金句
|
||||
|
||||
> "存储已不再只是数据承载的底层资源,而是影响GPU利用率、推理延迟与系统吞吐的关键变量。"
|
||||
|
||||
> "推理性能的提升不再只能依赖单向堆叠高端GPU,也可以通过'以存强算'的系统架构创新,释放中端算力资源潜能,从而实现更优的成本结构。"
|
||||
|
||||
> "英韧洞庭-N3X则以高带宽、低延迟、高IOPS与稳态输出能力,为KV Cache卸载提供坚实的硬件基础。"
|
||||
|
||||
---
|
||||
|
||||
## 总体评价
|
||||
|
||||
**亮点**:
|
||||
- 提供 KV Cache 卸载场景下 SSD 的完整选型指标集(顺序带宽/随机 IOPS/稳态/尾延迟),对存储选型有直接参考价值
|
||||
- "以存强算"视角(存储优化释放中端算力)为智算中心成本优化提供新思路
|
||||
- 存储与网络协同(400G→1.6T)的数据点有产业规划参考意义
|
||||
|
||||
**不足**:
|
||||
- 利益相关显著(实验室依托发布方环境、评测对象为合作伙伴),数据独立性存疑,需第三方复核
|
||||
- 系统级收益(20 倍/12 倍/百倍)缺对照基线与测试细则,易被误读为普适性能
|
||||
- 经济性论证缺失:未对比存储投入与 GPU 采购成本,无法支撑成本结论
|
||||
|
||||
**适用场景**:智算中心存储选型与架构规划人员;关注 KV Cache 卸载落地、GPU 利用率的推理平台团队;评估"以存强算"路线的产业决策者。
|
||||
|
||||
**关联建议**:与《下一代推理优化技术……测试(上)》的 HBM/DDR/NVMe 三级卸载设计联读,理解 SSD 在分层中的冷数据定位;对照焱融 YRCache 首轮评测与 ODCC 后续发布验证数据一致性;经济性判断可参考行业对 HBM vs SSD 卸载的 TCO 对比研究。
|
||||
|
||||
---
|
||||
|
||||
## 配图
|
||||
|
||||

|
||||
Reference in New Issue
Block a user