·3 分钟阅读
MiniMax M3 的 AgentX 结果:B200 与 B300 为何胜过机架级的 GB200 NVL72 与 GB300 NVL72
Dynamo router 成为瓶颈,没有提交使用上下文并行,而 AMD 完全没有用上 KV offload
agentxagenticbenchmarkinferenceminimaxb200b300gb200gb300nvl72dynamoamdrocm
关于智能体推理、AgentX 结果、芯片性能与 ML 基础设施的文章。
不熟悉相关概念? 浏览 AI 推理术语表。
Dynamo router 成为瓶颈,没有提交使用上下文并行,而 AMD 完全没有用上 KV offload
Kimi K3 的架构:压缩记忆、跨深度注意力、潜空间专家路由,以及服务性能
Rubin 基于 LUT 的 Tensor Core、Feynman、机架级架构、每兆瓦性能、每美元性能、软件改进、Rubin 公开软件栈、PyTorch、vLLM、OpenAI Triton
DSv4-Pro FP4 8K/1K,Dynamo+vLLM,两套机架均采用分离式部署。GB300 多出 50% 的 HBM(每 GPU 288 GB vs 192 GB)解锁了 GB200 无法容纳的更宽预填充+解码配方——尽管单 GPU TCO 溢价 20%,曲线中段性价比仍提升 2.31 倍。
DeepSeek R1 FP4 1k/1k。NVL72 的 72-GPU NVLink 扩展域允许解码使用最高 EP=32 的宽专家并行,而 B200 的 8-GPU NVLink 岛通过 RoCEv2 上限为 EP=8