DeepSeek V4 Pro 0813 1.6T
长上下文、多轮交互的真实智能体场景(AgentX)
B200
vLLM · FP4
MI355X
$0.031成本比 B200 高 30%
SGLang · FP4
B300
$0.019成本比 B200 低 22%
vLLM · FP4
GB200 NVL72
$0.046成本比 B200 高 94%
llm-d vLLM · FP4
GB300 NVL72
$0.011成本比 B200 低 52%
Dynamo vLLM · FP4
超大规模云厂商成本 ↓ 越低越好 来源:InferenceX 与 SemiAnalysis Market July 2026 Pricing Surveys & AI Cloud TCO Model
| 模型 · 场景 | B200 · 基准 | MI355X | B300 | GB200 NVL72 | GB300 NVL72 |
|---|---|---|---|---|---|
DeepSeek V4 Pro 0813 1.6T长上下文、多轮交互的真实智能体场景(AgentX) | vLLM · FP4 | $0.031成本比 B200 高 30% SGLang · FP4 | $0.019成本比 B200 低 22% vLLM · FP4 | $0.046成本比 B200 高 94% llm-d vLLM · FP4 | $0.011成本比 B200 低 52% Dynamo vLLM · FP4 |
Kimi K3 2.8T长上下文、多轮交互的真实智能体场景(AgentX) | Dynamo vLLM · FP4 | $0.084成本比 B200 低 20% vLLM · FP4 | $0.103与 B200 成本基本持平 vLLM · FP4 | $0.113成本比 B200 高 7% Dynamo vLLM · FP4 | $0.080成本比 B200 低 24% Dynamo vLLM · FP4 |
MiniMax M3 428B长上下文、多轮交互的真实智能体场景(AgentX) | — 无精确 @50 结果 | $0.014缺少可比较的 B200 基线 vLLM · FP4 | — 无精确 @50 结果 | — 无精确 @50 结果 | — 无精确 @50 结果 |
GLM5.2/GLM5.3 744B长上下文、多轮交互的真实智能体场景(AgentX) | — 无精确 @50 结果 | — 无精确 @50 结果 | — 无精确 @50 结果 | — 无精确 @50 结果 | — 无精确 @50 结果 |
Qwen3.5 397B长上下文、多轮交互的真实智能体场景(AgentX) | — 无精确 @50 结果 | $0.008缺少可比较的 B200 基线 SGLang · FP4 | $0.014缺少可比较的 B200 基线 SGLang · FP8 | — 无精确 @50 结果 | — 无精确 @50 结果 |
Qwen3.8 Flash Next 176B长上下文、多轮交互的真实智能体场景(AgentX) | — 该场景暂无数据 | — 该场景暂无数据 | — 无精确 @50 结果 | — 该场景暂无数据 | — 该场景暂无数据 |
DeepSeek V4 Pro 0813 1.6T8K/1K | TRTLLM · FP4 | $0.159成本比 B200 高 43% ATOM¹ · FP4 | $0.134成本比 B200 高 20% TRTLLM · FP4 | $0.514成本比 B200 高 360% Dynamo vLLM · FP4 | $0.213成本比 B200 高 91% Dynamo SGLang · FP4 · STP |
Qwen3.5 397B8K/1K | TRTLLM · FP4 | $0.056成本比 B200 高 56% SGLang · FP4 | $0.040成本比 B200 高 11% SGLang · FP4 | $0.142成本比 B200 高 295% Dynamo SGLang · FP8 · STP | $0.040成本比 B200 高 11% Dynamo TRTLLM · FP4 · STP |
DeepSeek R1 0528 671B维护模式目前已不再对该模型进行持续基准测试。8K/1K | TRTLLM · FP4 | $0.157成本比 B200 高 105% ATOM¹ · FP4 | $0.139成本比 B200 高 81% Dynamo TRTLLM · FP4 | $0.192成本比 B200 高 149% Dynamo SGLang · FP8 · STP | $0.230成本比 B200 高 200% Dynamo TRTLLM · FP8 · STP |
Kimi K2.5/2.6/2.7-Code 1T已弃用目前已不再对该模型进行持续基准测试。8K/1K | Dynamo TRTLLM · FP4 · STP | $0.132成本比 B200 高 57% ATOM¹ · FP4 · STP | $0.179成本比 B200 高 112% vLLM · FP4 · STP | $0.079成本比 B200 低 7% Dynamo TRTLLM · FP4 · STP | $0.098成本比 B200 高 17% Dynamo TRTLLM · FP4 · STP |
GLM5/5.1 744B已弃用目前已不再对该模型进行持续基准测试。8K/1K | SGLang · FP4 | $0.431成本比 B200 高 150% SGLang · FP8 | $0.210成本比 B200 高 22% SGLang · FP4 | $0.260成本比 B200 高 51% Dynamo TRTLLM · FP4 · STP | $0.281成本比 B200 高 63% Dynamo TRTLLM · FP4 · STP |
gpt-oss 120B已弃用目前已不再对该模型进行持续基准测试。8K/1K | TRTLLM · FP4 · STP | $0.010与 B200 成本基本持平 ATOM¹ · FP4 · STP | — 该场景暂无数据 | — 无精确 @50 结果 | — 该场景暂无数据 |
MiniMax M2.5/2.7 230B已弃用目前已不再对该模型进行持续基准测试。8K/1K | vLLM · FP4 · STP | $0.051成本比 B200 高 23% ATOM¹ · FP4 · STP | $0.051成本比 B200 高 24% vLLM · FP4 · STP | $0.041与 B200 成本基本持平 Dynamo vLLM · FP4 · STP | $0.047成本比 B200 高 13% Dynamo vLLM · FP4 · STP |
Llama 3.3 70B Instruct已弃用目前已不再对该模型进行持续基准测试。8K/1K | TRTLLM · FP4 · STP | $0.145成本比 B200 高 124% vLLM · FP4 · STP | — 该场景暂无数据 | — 该场景暂无数据 | — 该场景暂无数据 |
长上下文、多轮交互的真实智能体场景(AgentX)
长上下文、多轮交互的真实智能体场景(AgentX)
长上下文、多轮交互的真实智能体场景(AgentX)
长上下文、多轮交互的真实智能体场景(AgentX)
长上下文、多轮交互的真实智能体场景(AgentX)
长上下文、多轮交互的真实智能体场景(AgentX)
8K/1K
8K/1K
8K/1K
8K/1K
8K/1K
8K/1K
8K/1K
8K/1K
— = 无结果。∞ = 缺少 B200 基线。
如果某款芯片没有可用的 FP4 投机解码配置,则改用次优配置。