文章

关于智能体推理、AgentX 结果、芯片性能与 ML 基础设施的文章。

不熟悉相关概念? 浏览 AI 推理术语表

·3 分钟阅读

DeepSeek V4 Pro 的 AgentX 结果:B200 对比 B300 与 KV cache 工作集

多出 50% 的 HBM 能挤出额外吞吐量,逐点遥测数据说明了它究竟从何而来

agentxagenticbenchmarkinferencedeepseekb200b300h200nvidia
·3 分钟阅读

DeepSeek V4 Pro 的 AgentX 结果:GB200 与 GB300 的机架级分离式部署

两者都依赖 PD 分离,GB300 额外使用 DEP32 宽专家并行解码,而差距体现在首 token 延迟而非 token 速率上

agentxagenticbenchmarkinferencedeepseekgb200gb300nvl72disaggwide-epnvidia
·3 分钟阅读

DeepSeek V4 Pro 的 AgentX 结果:MI355X 对比 B200,以及 8 月 21 日的反转

在端到端延迟的每美元性能上,AMD 一度追平 B200 vLLM,随后上游 vLLM 的优化改变了格局

agentxagenticbenchmarkinferencedeepseekmi355xb200amdnvidia
·3 分钟阅读

GLM 5.3 的 AgentX 结果:MI355X ATOM 在部分曲线上胜过 GB300 NVL72

AMD 厂商引擎在每美元性能上胜出的区间,以及端到端归一化交互性究竟衡量什么

agentxagenticbenchmarkinferenceglm5mi355xgb300nvl72trtllmsglangamdnvidia
·2 分钟阅读

GLM 5.3 的 AgentX 结果:150 tok/s/user 下 NVIDIA 单 token 成本最多低 5 倍

在这个运行点上,即便 AMD 硬件白送也仍然填不平差距

agentxagenticbenchmarkinferenceglm5b200b300mi355xsglangnvidiaamd
·2 分钟阅读

Kimi K3 的 AgentX 结果:MI355X ATOM 在部分曲线上胜过 GB300 NVL72

AMD 的厂商引擎在每美元性能前沿上赢下了实打实的一段,而 Hopper 连服务 K3 都很吃力

agentxagenticbenchmarkinferencekimimi355xgb300nvl72h200amdnvidia
·3 分钟阅读

MiniMax M3 的 AgentX 结果:B300 TRT-LLM TP2 拿下桂冠

NVIDIA 横扫这个 432B 模型,而缺失的 DP attention 数据点说明了缓存局部性为何变成路由约束

agentxagenticbenchmarkinferenceminimaxb300b200gb200trtllmvllmnvidia
·25 分钟阅读

OpenAI Jalapeño:比 NVIDIA Blackwell 更强

OpenAI 自研 ASIC 对比 Rubin:Jalapeño 的 TCO、每兆瓦吞吐量,以及那些够辣的细节

inferencebenchmarkgpunvidiaopenaiasicrubin
·2 分钟阅读

Qwen3.5 397B 的 AgentX 结果:B300 FP4 的每美元性能是 H100 的 12 倍

在长上下文 agentic 工作负载上,四年硬件迭代加上 4 位格式能换来什么

agentxagenticbenchmarkinferenceqwenb300h100h200fp4fp8sglangnvidia
·2 分钟阅读

MI355X 对比 GB300 NVL72 推理性能:Qwen3.5 SGLang 上 20 倍差距

GatedDeltaNet、262k 原生上下文,以及同一引擎上 AMD 完全缺席的竞争

agentxagenticbenchmarkinferenceqwensglangtrtllmnvidiaamd
·71 分钟阅读

AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?

开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200

agentxagenticbenchmarkinferencegpunvidiaamdannouncement
·20 分钟阅读

在 NVIDIA GPU 上实现超高交互性?TileRT 登陆 InferenceX

运行在 NVIDIA GPU 上的 TileRT 软件能否与 Cerebras、Groq LPU、SambaNova 竞争?批大小为 1、分离式引擎、高吞吐量预填充引擎、高交互性解码引擎

benchmarkgpuinferencenvidiab200gb300tilertvllmglm5agentxagentic
·26 分钟阅读

Kimi K3:其人、其神话、其传奇

Kimi K3 的架构:压缩记忆、跨深度注意力、潜空间专家路由,以及服务性能

inferencebenchmarkgpukimivllmnvidiab200b300dynamo
·21 分钟阅读

Vera Rubin NVL72 对比 GB200 NVL72?推理 TCO 与架构分析

Rubin 基于 LUT 的 Tensor Core、Feynman、机架级架构、每兆瓦性能、每美元性能、软件改进、Rubin 公开软件栈、PyTorch、vLLM、OpenAI Triton

benchmarkgpuinferencenvidiarubingb200gb300deepseektrtllmdynamo
·31 分钟阅读

DeepSeekV4 1.6T 第0天至第43天性能演进 — Huawei、GB300 NVL72、MI355X、B200

第0天推理性能、InferenceX、26天内性能提升100倍、每百万 token 成本、Huawei 950DT 推理 Trace 分析

benchmarkgpuinferencedeepseeknvidiaamdhuaweigb300b300b200mi355xh200sglangvllmtrtllm
·11 分钟阅读

GB300 NVL72 vs GB200 NVL72 推理性能与性价比对比 — DeepSeek-V4-Pro 1.6T:吞吐量最高提升 2.83 倍

DSv4-Pro FP4 8K/1K,Dynamo+vLLM,两套机架均采用分离式部署。GB300 多出 50% 的 HBM(每 GPU 288 GB vs 192 GB)解锁了 GB200 无法容纳的更宽预填充+解码配方——尽管单 GPU TCO 溢价 20%,曲线中段性价比仍提升 2.31 倍。

benchmarkgpuinferencedeepseeknvidiagb300gb200nvl72vllmdynamowide-epdisagg
·11 分钟阅读

B200 NVFP4 对比 H200 FP8 运行 GLM-5:SGLang MTP 下性价比提升高达 3.65 倍

两款 GPU 均运行 SGLang EAGLE MTP;Blackwell 世代在峰值处带来约 1.2 倍的性价比提升,NVIDIA GLM-5-NVFP4 检查点搭配 FlashInfer TRT-LLM 稀疏 MLA 在 8K/1K 场景下再叠加约 2.4–3.0 倍优势

benchmarkgpuinferenceglm5nvidiab200h200sglangfp4
·13 分钟阅读

B200 NVFP4 vs H100 FP8 运行 MiniMax-M2.5:vLLM 下每美元性能最高提升 8.2 倍

vLLM PR #36307 为 MiniMax 在 B200 上解锁了 trtllm-gen FP8 MoE 模块化内核;结合 NVFP4,在 8K/1K 负载下性能/成本从 22 tok/s/user 时的 4.0 倍扩大到 110 tok/s/user 时的 8.2 倍

benchmarkgpuinferenceminimaxnvidiab200h100vllmfp4
·12 分钟阅读

B200 NVFP4 对比 H200 INT4 运行 Kimi K2.5/K2.6:性价比提升高达 2.95 倍

在 vLLM 8K/1K 工作负载下,B200 NVFP4 路径在 30–90 tok/s/user 推理区间内每百万 tokens 成本比 H200 INT4 低 2.71x–2.95x,比同一 B200 硬件上的 INT4 低 2.45x–2.74x。三个因素——B200 的 HBM 带宽、HBM 容量和 NVFP4 张量核心——可清晰分解该优势

benchmarkgpuinferencekiminvidiab200h200vllmnvfp4
·7 分钟阅读

AMD MI355X GLM-5 推理:SGLang FP8 单节点每百万 token 成本比 B200 最高低 40%

GLM-5 发布 14 周后,AMD 在 MI355X 上同时实现了 SGLang FP8 的 MTP 和非 MTP 方案 — 通过 TileLang 实现的融合 MLA + FP8 KV 缓存在大部分性能 Pareto 前沿上将单节点 FP8 成本曲线翻转为 AMD 占优

benchmarkgpuinferenceglm5amdnvidiami355xb200sglangrocm
·9 分钟阅读

GB200 NVL72 对比 B200 运行 DeepSeek R1 670B:在 125 tok/s/user 下每 GPU 吞吐量最高达 4.4 倍

DeepSeek R1 FP4 1k/1k。NVL72 的 72-GPU NVLink 扩展域允许解码使用最高 EP=32 的宽专家并行,而 B200 的 8-GPU NVLink 岛通过 RoCEv2 上限为 EP=8

benchmarkgpuinferencedeepseeknvidiagb200b200nvl72trtllmdynamowide-epdisagg
·5 分钟阅读

SGLang 0.5.6 在 B200 DeepSeek R1 FP4 上的表现:低并发下最高提升 1.8 倍

针对 DeepSeek V3 的分段 CUDA graph、统一事件循环和 JIT 内核将 8k/1k 吞吐量从 508 提升至 907 tok/s/GPU,使用相同的 16 GPU B200 资源池

benchmarkinferencegpunvidiab200deepseeksglangfp4
·7 分钟阅读

GB200 NVL72 vs B200 Kimi K2.5 推理对比:宽 EP vLLM 带来 3.1 倍提升

NVL72 的机架级 NVLink 使 Dynamo vLLM 能够以最高 Decode EP 16 运行 Kimi K2.5 宽 EP,在 8k/1k NVFP4 下峰值吞吐量从 4,021 提升至 12,587 tok/s/GPU

benchmarkgpuinferencekiminvidiagb200b200vllmnvl72wide-ep