推理服务
前缀缓存命中率
也称为 prefix cache hit rate、缓存命中率、KV 复用率
先用大白话
命中率是指提示词中有多少 token 直接来自缓存而无需重算,在长会话中这通常是绝大部分。
技术定义
前缀缓存命中率是 prefill 阶段由已缓存 KV 状态满足、而非重新计算的输入 token 占比。
工程细节
命中率必须与产生它的缓存层级一起看才有意义,因为从加速器显存读取的 token 与从主机内存取回的 token,代价完全不同。它也不只取决于容量:淘汰策略可能丢掉仍会被用到的前缀,路由也可能把请求发到从未持有该前缀的 worker。
为什么重要
在多轮流量下,命中率基本决定了 prefill 的开销,因为每一轮都会把整段对话再加一点新内容重新发过来。一旦复用率很高,剩余的 prefill 工作就主要是真正的新 token,瓶颈也从计算转向缓存管理。
如何在 InferenceX 中解读
AgentX 点详情视图会按缓存层级分别展示命中率随时间的变化,并给出 prompt token 来源拆分。如果一个数据点在低命中率下报出很高的总吞吐量,说明它做的 prefill 工作远多于缓存良好的部署。
参考资料
在真实基准中理解这一概念
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
Agentic 工作负载简述
多轮会话、长上下文与近乎完全的 prefix 复用,让 agentic 推理成为一个系统问题,也改变了基准测试需要测量的内容
面向 LLM 推理的 Agentic Benchmark:指标与方法
Agent Benchmark 如何回放长上下文、多轮工作负载,并测量延迟、吞吐量、cache 行为与推理服务成本
DeepSeek V4 Pro 的 AgentX 结果:B200 对比 B300 与 KV cache 工作集
多出 50% 的 HBM 能挤出额外吞吐量,逐点遥测数据说明了它究竟从何而来