文章

关于智能体推理、AgentX 结果、芯片性能与 ML 基础设施的文章。

不熟悉相关概念? 浏览 AI 推理术语表

·3 分钟阅读

DeepSeek V4 Pro 的 AgentX 结果:B200 对比 B300 与 KV cache 工作集

多出 50% 的 HBM 能挤出额外吞吐量,逐点遥测数据说明了它究竟从何而来

agentxagenticbenchmarkinferencedeepseekb200b300h200nvidia
·2 分钟阅读

Kimi K3 的 AgentX 结果:MI355X ATOM 在部分曲线上胜过 GB300 NVL72

AMD 的厂商引擎在每美元性能前沿上赢下了实打实的一段,而 Hopper 连服务 K3 都很吃力

agentxagenticbenchmarkinferencekimimi355xgb300nvl72h200amdnvidia
·2 分钟阅读

Qwen3.5 397B 的 AgentX 结果:B300 FP4 的每美元性能是 H100 的 12 倍

在长上下文 agentic 工作负载上,四年硬件迭代加上 4 位格式能换来什么

agentxagenticbenchmarkinferenceqwenb300h100h200fp4fp8sglangnvidia
·31 分钟阅读

DeepSeekV4 1.6T 第0天至第43天性能演进 — Huawei、GB300 NVL72、MI355X、B200

第0天推理性能、InferenceX、26天内性能提升100倍、每百万 token 成本、Huawei 950DT 推理 Trace 分析

benchmarkgpuinferencedeepseeknvidiaamdhuaweigb300b300b200mi355xh200sglangvllmtrtllm
·11 分钟阅读

B200 NVFP4 对比 H200 FP8 运行 GLM-5:SGLang MTP 下性价比提升高达 3.65 倍

两款 GPU 均运行 SGLang EAGLE MTP;Blackwell 世代在峰值处带来约 1.2 倍的性价比提升,NVIDIA GLM-5-NVFP4 检查点搭配 FlashInfer TRT-LLM 稀疏 MLA 在 8K/1K 场景下再叠加约 2.4–3.0 倍优势

benchmarkgpuinferenceglm5nvidiab200h200sglangfp4
·12 分钟阅读

B200 NVFP4 对比 H200 INT4 运行 Kimi K2.5/K2.6:性价比提升高达 2.95 倍

在 vLLM 8K/1K 工作负载下,B200 NVFP4 路径在 30–90 tok/s/user 推理区间内每百万 tokens 成本比 H200 INT4 低 2.71x–2.95x,比同一 B200 硬件上的 INT4 低 2.45x–2.74x。三个因素——B200 的 HBM 带宽、HBM 容量和 NVFP4 张量核心——可清晰分解该优势

benchmarkgpuinferencekiminvidiab200h200vllmnvfp4