InferenceXbySemiAnalysis logo
首页AgentX新总览仪表板性能对比技术文章关于
Star1,585EN

文章

关于智能体推理、AgentX 结果、芯片性能与 ML 基础设施的文章。

不熟悉相关概念? 浏览 AI 推理术语表。

全部agenticagentsagentxamdannouncementasicb200b300benchmarkdeepseekdisaggdynamofp4fp8gb200gb300glm5gpuh100h200huaweiinferencekimilatencymi355xminimaxnvfp4nvidianvl72openaiqwenrocmrubinsglangthroughputtilerttrtllmvllmwide-ep
2026年8月25日·3 分钟阅读

MiniMax M3 的 AgentX 结果:B200 与 B300 为何胜过机架级的 GB200 NVL72 与 GB300 NVL72

Dynamo router 成为瓶颈,没有提交使用上下文并行,而 AMD 完全没有用上 KV offload

agentxagenticbenchmarkinferenceminimaxb200b300gb200gb300nvl72dynamoamdrocm
2026年8月25日·3 分钟阅读

MiniMax M3 的 AgentX 结果:B300 TRT-LLM TP2 拿下桂冠

NVIDIA 横扫这个 432B 模型,而缺失的 DP attention 数据点说明了缓存局部性为何变成路由约束

agentxagenticbenchmarkinferenceminimaxb300b200gb200trtllmvllmnvidia
2026年5月26日·13 分钟阅读

B200 NVFP4 vs H100 FP8 运行 MiniMax-M2.5:vLLM 下每美元性能最高提升 8.2 倍

vLLM PR #36307 为 MiniMax 在 B200 上解锁了 trtllm-gen FP8 MoE 模块化内核;结合 NVFP4,在 8K/1K 负载下性能/成本从 22 tok/s/user 时的 4.0 倍扩大到 110 tok/s/user 时的 8.2 倍

benchmarkgpuinferenceminimaxnvidiab200h100vllmfp4
SemiAnalysis logo

InferenceX 持续开展开源的 agentic 推理基准测试,发布来自真实环境、可复现、可审计的性能数据,并获得 OpenAI、Meta、Oracle、Microsoft 等万亿美元级 AI 基础设施运营方的信赖。

SemiAnalysisSemiAnalysis 官网订阅通讯关于 SemiAnalysis
法律信息原住民传统领地声明隐私政策Cookie 政策
参与贡献基准测试仓库AgentX 测试框架可视化工具
更多
业界评价AgentX遥测数据技术文章API 文档芯片可靠性每美元性能模型架构AI 推理术语表芯片规格与价格GPU 排行榜模型在 GPU 上的实测结果

如果这些数据对您的工作有帮助,欢迎在 GitHub 上点个 Star,或分享给同事。

© 2026 semianalysis.com. 版权所有。