文章

关于智能体推理、AgentX 结果、芯片性能与 ML 基础设施的文章。

不熟悉相关概念? 浏览 AI 推理术语表

·3 分钟阅读

DeepSeek V4 Pro 的 AgentX 结果:B200 对比 B300 与 KV cache 工作集

多出 50% 的 HBM 能挤出额外吞吐量,逐点遥测数据说明了它究竟从何而来

agentxagenticbenchmarkinferencedeepseekb200b300h200nvidia
·3 分钟阅读

DeepSeek V4 Pro 的 AgentX 结果:GB200 与 GB300 的机架级分离式部署

两者都依赖 PD 分离,GB300 额外使用 DEP32 宽专家并行解码,而差距体现在首 token 延迟而非 token 速率上

agentxagenticbenchmarkinferencedeepseekgb200gb300nvl72disaggwide-epnvidia
·3 分钟阅读

DeepSeek V4 Pro 的 AgentX 结果:MI355X 对比 B200,以及 8 月 21 日的反转

在端到端延迟的每美元性能上,AMD 一度追平 B200 vLLM,随后上游 vLLM 的优化改变了格局

agentxagenticbenchmarkinferencedeepseekmi355xb200amdnvidia
·3 分钟阅读

GLM 5.3 的 AgentX 结果:MI355X ATOM 在部分曲线上胜过 GB300 NVL72

AMD 厂商引擎在每美元性能上胜出的区间,以及端到端归一化交互性究竟衡量什么

agentxagenticbenchmarkinferenceglm5mi355xgb300nvl72trtllmsglangamdnvidia
·2 分钟阅读

GLM 5.3 的 AgentX 结果:150 tok/s/user 下 NVIDIA 单 token 成本最多低 5 倍

在这个运行点上,即便 AMD 硬件白送也仍然填不平差距

agentxagenticbenchmarkinferenceglm5b200b300mi355xsglangnvidiaamd
·2 分钟阅读

Kimi K3 的 AgentX 结果:MI355X ATOM 在部分曲线上胜过 GB300 NVL72

AMD 的厂商引擎在每美元性能前沿上赢下了实打实的一段,而 Hopper 连服务 K3 都很吃力

agentxagenticbenchmarkinferencekimimi355xgb300nvl72h200amdnvidia
·3 分钟阅读

MiniMax M3 的 AgentX 结果:B200 与 B300 为何胜过机架级的 GB200 NVL72 与 GB300 NVL72

Dynamo router 成为瓶颈,没有提交使用上下文并行,而 AMD 完全没有用上 KV offload

agentxagenticbenchmarkinferenceminimaxb200b300gb200gb300nvl72dynamoamdrocm
·3 分钟阅读

MiniMax M3 的 AgentX 结果:B300 TRT-LLM TP2 拿下桂冠

NVIDIA 横扫这个 432B 模型,而缺失的 DP attention 数据点说明了缓存局部性为何变成路由约束

agentxagenticbenchmarkinferenceminimaxb300b200gb200trtllmvllmnvidia
·2 分钟阅读

Qwen3.5 397B 的 AgentX 结果:B300 FP4 的每美元性能是 H100 的 12 倍

在长上下文 agentic 工作负载上,四年硬件迭代加上 4 位格式能换来什么

agentxagenticbenchmarkinferenceqwenb300h100h200fp4fp8sglangnvidia
·2 分钟阅读

MI355X 对比 GB300 NVL72 推理性能:Qwen3.5 SGLang 上 20 倍差距

GatedDeltaNet、262k 原生上下文,以及同一引擎上 AMD 完全缺席的竞争

agentxagenticbenchmarkinferenceqwensglangtrtllmnvidiaamd
·71 分钟阅读

AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?

开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200

agentxagenticbenchmarkinferencegpunvidiaamdannouncement
·12 分钟阅读

面向 LLM 推理的 Agentic Benchmark:指标与方法

Agent Benchmark 如何回放长上下文、多轮工作负载,并测量延迟、吞吐量、cache 行为与推理服务成本

benchmarkagentsagenticinferencelatencythroughput
·6 分钟阅读

Agentic 工作负载简述

多轮会话、长上下文与近乎完全的 prefix 复用,让 agentic 推理成为一个系统问题,也改变了基准测试需要测量的内容

agenticagentsagentxbenchmarkinference
·20 分钟阅读

在 NVIDIA GPU 上实现超高交互性?TileRT 登陆 InferenceX

运行在 NVIDIA GPU 上的 TileRT 软件能否与 Cerebras、Groq LPU、SambaNova 竞争?批大小为 1、分离式引擎、高吞吐量预填充引擎、高交互性解码引擎

benchmarkgpuinferencenvidiab200gb300tilertvllmglm5agentxagentic