KV cache offload
也称为 KV cache offload、CPU offload、KV 卸载
先用大白话
把芯片放不下的注意力状态暂存到主机内存,长会话下一轮就能直接恢复,而不必整段重算。
技术定义
KV cache offload 把 KV block 从加速器显存移到更慢的存储层(通常是主机 DRAM),并在后续请求复用该前缀时再读回来。
工程细节
offload 通常实现为写穿缓存:写入 HBM 缓存的前缀会同时写入较慢的一层,因此当 offload 池容量大致是 HBM 的 1.5 到 3 倍时效果最好。在 agentic 的上下文长度下,重新载入长前缀远比重算划算;但对短提示词结论相反,传输开销会超过它省下的 prefill。
为什么重要
长 agentic 会话超出 HBM 中 KV 容量的时间,远早于超出合理的 DRAM 预算,因此 offload 决定了有多少并发对话仍可恢复。它也会转移瓶颈:前缀能够留存之后,store 与 load 路径、传输批量化和索引记账才是值得优化的开销。
如何在 InferenceX 中解读
InferenceX 会给每个使用了 offload 的数据点加上虚线光环,无论它是否位于 Pareto 前沿;点详情视图还会给出 offload 类型、引擎,以及芯片与 CPU 两侧的缓存命中率。offload 属于允许但可选的优化,因此同一条曲线上可以同时存在启用和未启用的数据点。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
Agentic 工作负载简述
多轮会话、长上下文与近乎完全的 prefix 复用,让 agentic 推理成为一个系统问题,也改变了基准测试需要测量的内容
Kimi K3:其人、其神话、其传奇
Kimi K3 的架构:压缩记忆、跨深度注意力、潜空间专家路由,以及服务性能
DeepSeek V4 Pro 的 AgentX 结果:B200 对比 B300 与 KV cache 工作集
多出 50% 的 HBM 能挤出额外吞吐量,逐点遥测数据说明了它究竟从何而来