轨迹回放
也称为 trace replay、工作负载回放、会话回放
先用大白话
轨迹回放重现已记录会话的请求大小、先后关系与时间间隔,让基准测试按照原始工作负载的节奏发送请求。
技术定义
轨迹回放是一种基准测试方法,它把记录下来的请求关系、长度和时间信息转化为可重复运行的系统工作负载。
工程细节
回放可以保留由主 agent 轮次、并行 subagent 分支和辅助请求组成的有向图。确定性合成 token 会替换私有内容,同时保留 token 数量与前缀关系。轮次间记录的停顿则重现 agent 使用工具或等待依赖项的时间。
为什么重要
这种方法能够表达独立提示词列表缺少的流量特征,也能使用相同会话形状重复比较不同软硬件。AgentX 会在公开回放数据前移除源会话内容。
如何在 InferenceX 中解读
AgentX 通过 AIPerf 回放由轨迹衍生的会话。固定 seed 决定会话采样、起点和合成内容。对外结果只统计 cache warmup 后的 profiling 窗口,使多次运行聚焦于稳态服务表现。
参考资料
在真实基准中理解这一概念
Agentic 工作负载简述
多轮会话、长上下文与近乎完全的 prefix 复用,让 agentic 推理成为一个系统问题,也改变了基准测试需要测量的内容
面向 LLM 推理的 Agentic Benchmark:指标与方法
Agent Benchmark 如何回放长上下文、多轮工作负载,并测量延迟、吞吐量、cache 行为与推理服务成本
在 NVIDIA GPU 上实现超高交互性?TileRT 登陆 InferenceX
运行在 NVIDIA GPU 上的 TileRT 软件能否与 Cerebras、Groq LPU、SambaNova 竞争?批大小为 1、分离式引擎、高吞吐量预填充引擎、高交互性解码引擎
Vera Rubin NVL72 对比 GB200 NVL72?推理 TCO 与架构分析
Rubin 基于 LUT 的 Tensor Core、Feynman、机架级架构、每兆瓦性能、每美元性能、软件改进、Rubin 公开软件栈、PyTorch、vLLM、OpenAI Triton
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200