AgentX
也称为 AgentX 基准测试、AgentX 场景
先用大白话
AgentX 是 InferenceX 用来测试完整长上下文、多轮编码智能体会话的工作负载。
技术定义
AgentX 是 InferenceX 的智能体推理基准测试场景,其工作负载形状来自自愿提供的编码智能体轨迹,并在移除原始内容后构建。
工程细节
AgentX 使用确定性合成 token 重建会话结构。回放会保留请求长度、轮次间隔、共享前缀增长、工具等待以及主 agent 与 subagent 的依赖关系;原始提示词、生成代码和工具 payload 不会进入测试数据。推理栈只接收请求模式。
为什么重要
长上下文考验 KV cache 容量,重复前缀考验 cache 复用,分支时序则考验请求调度。这些影响在短小独立请求中较少出现。最终曲线反映推理系统在智能体流量下的整体表现。
如何在 InferenceX 中解读
具备对应数据的模型默认显示 Agentic 场景。比较 AgentX 结果时,应使用兼容设置下的其他 AgentX 运行,并同时查看吞吐量、延迟与交互性。固定序列场景适合分析传统请求流。
参考资料
在真实基准中理解这一概念
Agentic 工作负载简述
多轮会话、长上下文与近乎完全的 prefix 复用,让 agentic 推理成为一个系统问题,也改变了基准测试需要测量的内容
面向 LLM 推理的 Agentic Benchmark:指标与方法
Agent Benchmark 如何回放长上下文、多轮工作负载,并测量延迟、吞吐量、cache 行为与推理服务成本
在 NVIDIA GPU 上实现超高交互性?TileRT 登陆 InferenceX
运行在 NVIDIA GPU 上的 TileRT 软件能否与 Cerebras、Groq LPU、SambaNova 竞争?批大小为 1、分离式引擎、高吞吐量预填充引擎、高交互性解码引擎
Vera Rubin NVL72 对比 GB200 NVL72?推理 TCO 与架构分析
Rubin 基于 LUT 的 Tensor Core、Feynman、机架级架构、每兆瓦性能、每美元性能、软件改进、Rubin 公开软件栈、PyTorch、vLLM、OpenAI Triton
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200