文章

关于智能体推理、AgentX 结果、芯片性能与 ML 基础设施的文章。

不熟悉相关概念? 浏览 AI 推理术语表

·3 分钟阅读

GLM 5.3 的 AgentX 结果:MI355X ATOM 在部分曲线上胜过 GB300 NVL72

AMD 厂商引擎在每美元性能上胜出的区间,以及端到端归一化交互性究竟衡量什么

agentxagenticbenchmarkinferenceglm5mi355xgb300nvl72trtllmsglangamdnvidia
·3 分钟阅读

MiniMax M3 的 AgentX 结果:B300 TRT-LLM TP2 拿下桂冠

NVIDIA 横扫这个 432B 模型,而缺失的 DP attention 数据点说明了缓存局部性为何变成路由约束

agentxagenticbenchmarkinferenceminimaxb300b200gb200trtllmvllmnvidia
·2 分钟阅读

MI355X 对比 GB300 NVL72 推理性能:Qwen3.5 SGLang 上 20 倍差距

GatedDeltaNet、262k 原生上下文,以及同一引擎上 AMD 完全缺席的竞争

agentxagenticbenchmarkinferenceqwensglangtrtllmnvidiaamd
·21 分钟阅读

Vera Rubin NVL72 对比 GB200 NVL72?推理 TCO 与架构分析

Rubin 基于 LUT 的 Tensor Core、Feynman、机架级架构、每兆瓦性能、每美元性能、软件改进、Rubin 公开软件栈、PyTorch、vLLM、OpenAI Triton

benchmarkgpuinferencenvidiarubingb200gb300deepseektrtllmdynamo
·31 分钟阅读

DeepSeekV4 1.6T 第0天至第43天性能演进 — Huawei、GB300 NVL72、MI355X、B200

第0天推理性能、InferenceX、26天内性能提升100倍、每百万 token 成本、Huawei 950DT 推理 Trace 分析

benchmarkgpuinferencedeepseeknvidiaamdhuaweigb300b300b200mi355xh200sglangvllmtrtllm
·9 分钟阅读

GB200 NVL72 对比 B200 运行 DeepSeek R1 670B:在 125 tok/s/user 下每 GPU 吞吐量最高达 4.4 倍

DeepSeek R1 FP4 1k/1k。NVL72 的 72-GPU NVLink 扩展域允许解码使用最高 EP=32 的宽专家并行,而 B200 的 8-GPU NVLink 岛通过 RoCEv2 上限为 EP=8

benchmarkgpuinferencedeepseeknvidiagb200b200nvl72trtllmdynamowide-epdisagg