DeepSeek V4 Pro 0813 1.6T
长上下文、多轮交互的真实智能体场景(AgentX)
B200
vLLM · FP4
MI355X
$0.031成本比 B200 高 30%
SGLang · FP4
B300
$0.019成本比 B200 低 22%
vLLM · FP4
GB200 NVL72
$0.046成本比 B200 高 94%
llm-d vLLM · FP4
GB300 NVL72
$0.011成本比 B200 低 52%
Dynamo vLLM · FP4
超大规模云厂商成本 ↓ 越低越好 来源:InferenceX 与 SemiAnalysis Market July 2026 Pricing Surveys & AI Cloud TCO Model
| 模型 · 场景 | B200 · 基准 | MI355X | B300 | GB200 NVL72 | GB300 NVL72 |
|---|---|---|---|---|---|
DeepSeek V4 Pro 0813 1.6T长上下文、多轮交互的真实智能体场景(AgentX) | vLLM · FP4 | $0.031成本比 B200 高 30% SGLang · FP4 | $0.019成本比 B200 低 22% vLLM · FP4 | $0.046成本比 B200 高 94% llm-d vLLM · FP4 | $0.011成本比 B200 低 52% Dynamo vLLM · FP4 |
Kimi K3 2.8T长上下文、多轮交互的真实智能体场景(AgentX) | Dynamo vLLM · FP4 | $0.084成本比 B200 低 20% vLLM · FP4 | $0.103与 B200 成本基本持平 vLLM · FP4 | $0.113成本比 B200 高 7% Dynamo vLLM · FP4 | $0.080成本比 B200 低 24% Dynamo vLLM · FP4 |
MiniMax M3 428B长上下文、多轮交互的真实智能体场景(AgentX) | — 无精确 @50 结果 | $0.014缺少可比较的 B200 基线 vLLM · FP4 | — 无精确 @50 结果 | — 无精确 @50 结果 | — 无精确 @50 结果 |
Qwen3.5 397B长上下文、多轮交互的真实智能体场景(AgentX) | — 无精确 @50 结果 | $0.008缺少可比较的 B200 基线 SGLang · FP4 | $0.014缺少可比较的 B200 基线 SGLang · FP8 | — 无精确 @50 结果 | — 无精确 @50 结果 |
DeepSeek V4 Pro 0813 1.6T8K/1K | vLLM · FP4 | $0.346成本比 B200 高 15% MoRI SGLang · FP4 | $0.245成本比 B200 低 18% SGLang · FP4 | $0.514成本比 B200 高 71% Dynamo vLLM · FP4 | $0.213成本比 B200 低 29% Dynamo SGLang · FP4 · STP |
Qwen3.5 397B8K/1K | SGLang · FP4 | $0.056成本比 B200 高 45% SGLang · FP4 | $0.040与 B200 成本基本持平 SGLang · FP4 | $0.142成本比 B200 高 268% Dynamo SGLang · FP8 · STP | $0.133成本比 B200 高 246% Dynamo SGLang · FP8 · STP |
DeepSeek R1 0528 671B维护模式目前已不再对该模型进行持续基准测试。8K/1K | SGLang · FP4 | $0.259成本比 B200 高 149% SGLang · FP8 | $0.353成本比 B200 高 239% SGLang · FP8 | $0.192成本比 B200 高 84% Dynamo SGLang · FP8 · STP | $0.263成本比 B200 高 152% Dynamo SGLang · FP8 · STP |
Kimi K2.5/2.6/2.7-Code 1T已弃用目前已不再对该模型进行持续基准测试。8K/1K | Dynamo vLLM · FP4 · STP | $0.147成本比 B200 高 6% vLLM · FP4 · STP | $0.179成本比 B200 高 29% vLLM · FP4 · STP | $0.112成本比 B200 低 19% Dynamo vLLM · FP4 · STP | $0.115成本比 B200 低 18% Dynamo vLLM · FP4 · STP |
GLM5/5.1 744B已弃用目前已不再对该模型进行持续基准测试。8K/1K | SGLang · FP4 | $0.431成本比 B200 高 150% SGLang · FP8 | $0.210成本比 B200 高 22% SGLang · FP4 | $0.333成本比 B200 高 93% Dynamo SGLang · FP4 · STP | $0.433成本比 B200 高 152% Dynamo SGLang · FP4 · STP |
gpt-oss 120B已弃用目前已不再对该模型进行持续基准测试。8K/1K | vLLM · FP4 · STP | $0.011与 B200 成本基本持平 vLLM · FP4 · STP | — 该场景暂无数据 | — 该场景暂无数据 | — 该场景暂无数据 |
MiniMax M2.5/2.7 230B已弃用目前已不再对该模型进行持续基准测试。8K/1K | vLLM · FP4 · STP | $0.054成本比 B200 高 31% vLLM · FP4 · STP | $0.051成本比 B200 高 24% vLLM · FP4 · STP | $0.041与 B200 成本基本持平 Dynamo vLLM · FP4 · STP | $0.047成本比 B200 高 13% Dynamo vLLM · FP4 · STP |
Llama 3.3 70B Instruct已弃用目前已不再对该模型进行持续基准测试。8K/1K | vLLM · FP4 · STP | $0.145成本比 B200 高 85% vLLM · FP4 · STP | — 该场景暂无数据 | — 该场景暂无数据 | — 该场景暂无数据 |
长上下文、多轮交互的真实智能体场景(AgentX)
长上下文、多轮交互的真实智能体场景(AgentX)
长上下文、多轮交互的真实智能体场景(AgentX)
长上下文、多轮交互的真实智能体场景(AgentX)
8K/1K
8K/1K
8K/1K
8K/1K
8K/1K
8K/1K
8K/1K
8K/1K
— = 无结果。∞ = 缺少 B200 基线。
如果某款芯片没有可用的 FP4 投机解码配置,则改用次优配置。