文章

关于智能体推理、AgentX 结果、芯片性能与 ML 基础设施的文章。

不熟悉相关概念? 浏览 AI 推理术语表

·3 分钟阅读

DeepSeek V4 Pro 的 AgentX 结果:B200 对比 B300 与 KV cache 工作集

多出 50% 的 HBM 能挤出额外吞吐量,逐点遥测数据说明了它究竟从何而来

agentxagenticbenchmarkinferencedeepseekb200b300h200nvidia
·2 分钟阅读

GLM 5.3 的 AgentX 结果:150 tok/s/user 下 NVIDIA 单 token 成本最多低 5 倍

在这个运行点上,即便 AMD 硬件白送也仍然填不平差距

agentxagenticbenchmarkinferenceglm5b200b300mi355xsglangnvidiaamd
·3 分钟阅读

MiniMax M3 的 AgentX 结果:B200 与 B300 为何胜过机架级的 GB200 NVL72 与 GB300 NVL72

Dynamo router 成为瓶颈,没有提交使用上下文并行,而 AMD 完全没有用上 KV offload

agentxagenticbenchmarkinferenceminimaxb200b300gb200gb300nvl72dynamoamdrocm
·3 分钟阅读

MiniMax M3 的 AgentX 结果:B300 TRT-LLM TP2 拿下桂冠

NVIDIA 横扫这个 432B 模型,而缺失的 DP attention 数据点说明了缓存局部性为何变成路由约束

agentxagenticbenchmarkinferenceminimaxb300b200gb200trtllmvllmnvidia
·2 分钟阅读

Qwen3.5 397B 的 AgentX 结果:B300 FP4 的每美元性能是 H100 的 12 倍

在长上下文 agentic 工作负载上,四年硬件迭代加上 4 位格式能换来什么

agentxagenticbenchmarkinferenceqwenb300h100h200fp4fp8sglangnvidia
·26 分钟阅读

Kimi K3:其人、其神话、其传奇

Kimi K3 的架构:压缩记忆、跨深度注意力、潜空间专家路由,以及服务性能

inferencebenchmarkgpukimivllmnvidiab200b300dynamo
·31 分钟阅读

DeepSeekV4 1.6T 第0天至第43天性能演进 — Huawei、GB300 NVL72、MI355X、B200

第0天推理性能、InferenceX、26天内性能提升100倍、每百万 token 成本、Huawei 950DT 推理 Trace 分析

benchmarkgpuinferencedeepseeknvidiaamdhuaweigb300b300b200mi355xh200sglangvllmtrtllm