·3 分钟阅读
MiniMax M3 的 AgentX 结果:B200 与 B300 为何胜过机架级的 GB200 NVL72 与 GB300 NVL72
Dynamo router 成为瓶颈,没有提交使用上下文并行,而 AMD 完全没有用上 KV offload
agentxagenticbenchmarkinferenceminimaxb200b300gb200gb300nvl72dynamoamdrocm
关于智能体推理、AgentX 结果、芯片性能与 ML 基础设施的文章。
不熟悉相关概念? 浏览 AI 推理术语表。
Dynamo router 成为瓶颈,没有提交使用上下文并行,而 AMD 完全没有用上 KV offload
NVIDIA 横扫这个 432B 模型,而缺失的 DP attention 数据点说明了缓存局部性为何变成路由约束
vLLM PR #36307 为 MiniMax 在 B200 上解锁了 trtllm-gen FP8 MoE 模块化内核;结合 NVFP4,在 8K/1K 负载下性能/成本从 22 tok/s/user 时的 4.0 倍扩大到 110 tok/s/user 时的 8.2 倍