2026年8月19日·12 分钟阅读面向 LLM 推理的 Agentic Benchmark:指标与方法Agent Benchmark 如何回放长上下文、多轮工作负载,并测量延迟、吞吐量、cache 行为与推理服务成本benchmarkagentsagenticinferencelatencythroughput