AgentX|最新结果

真实智能体工作负载下的推理性能对比

比较不同硬件平台在长上下文、多轮智能体工作负载下的推理性能,覆盖 OpenAI Jalapeño、MI355X、GB300 NVL72、GB200 NVL72、B200、H200、H100 和 RTX Pro,即将支持 TPUv7/v8、Rubin NVL72 与 MI455X UALoE72。

对比结果目录

AgentX 与 8K→1K 结果

305 组推理基准测试的正面对比,涵盖 DeepSeekv4 Pro 0813 1.6T, DeepSeek R1, Kimi K3 2.8T, Kimi K2.5/K2.6/K2.7-Code 1T, GLM 5/5.1, GLM 5.3 744B, MiniMax M3 428B, MiniMax M2.5/M2.7, Qwen 3.8 Flash Next 176B-A6B, Qwen 3.5 397B-A17B, gpt-oss 120B, and Llama 3.3 70B。已有 AgentX 数据的模型默认打开长上下文、多轮 trace replay 结果;尚未纳入 AgentX 的模型默认打开受控的 8K→1K 工作负载。每张卡片均标明对应场景。

DeepSeek R1

36 组芯片对比具有 DeepSeek R1 的基准测试数据。

MiniMax M3 428B

36 组芯片对比具有 MiniMax M3 428B 的基准测试数据。

MiniMax M2.5/M2.7

36 组芯片对比具有 MiniMax M2.5/M2.7 的基准测试数据。

Qwen 3.8 Flash Next 176B-A6B

3 组芯片对比具有 Qwen 3.8 Flash Next 176B-A6B 的基准测试数据。

Qwen 3.5 397B-A17B

45 组芯片对比具有 Qwen 3.5 397B-A17B 的基准测试数据。