投机解码
也称为 speculative decoding、草稿与验证解码
先用大白话
投机解码先让成本较低的辅助模块提前生成多个 token,再交给完整模型一次性验证,从而减少逐个生成的步骤。
技术定义
投机解码先以较低成本生成多个候选 token,再由目标模型批量验证,从而减少成本较高的串行 decode 步骤。
工程细节
draft model 或内置预测头会生成候选 token,目标模型再通过一次批量验证评估这些候选,并接受其中有效的连续前缀。只要算法实现严格,目标分布就不会改变。
为什么重要
加速取决于草稿 token 的接受数量,以及草稿与验证成本。稠密模型和 MoE 的表现可能不同,因为验证多个位置可能激活更多专家权重。
如何在 InferenceX 中解读
在固定序列场景中,投机解码属于曲线标识的一部分,因此启用和未启用 MTP 的测试配置会分别绘制。Agentic 曲线则将投机解码作为数据点级元数据,并将这些点合并到同一条曲线中;每个提示框仍会注明具体方式。这是因为 AgentX 按模型、芯片 SKU 和引擎展示可达到的最佳曲线。由于 AgentX 回放使用合成内容,speculator 接受的 draft token 数并不具有代表性,因此运行时会使用从外部 agentic 编码数据集采集的接受长度,并按模型、speculator、draft 长度和思考模式分别配置。
参考资料
在真实基准中理解这一概念
InferenceX v2:NVIDIA Blackwell 对决 AMD 与 Hopper — 前身为 InferenceMAX
GB300 NVL72、MI355X、B200、H100、分离式推理、宽专家并行、大规模混合专家、SGLang、vLLM、TRTLLM
DeepSeekV4 1.6T 第0天至第43天性能演进 — Huawei、GB300 NVL72、MI355X、B200
第0天推理性能、InferenceX、26天内性能提升100倍、每百万 token 成本、Huawei 950DT 推理 Trace 分析
B200 NVFP4 对比 H200 FP8 运行 GLM-5:SGLang MTP 下性价比提升高达 3.65 倍
两款 GPU 均运行 SGLang EAGLE MTP;Blackwell 世代在峰值处带来约 1.2 倍的性价比提升,NVIDIA GLM-5-NVFP4 检查点搭配 FlashInfer TRT-LLM 稀疏 MLA 在 8K/1K 场景下再叠加约 2.4–3.0 倍优势
Kimi K3:其人、其神话、其传奇
Kimi K3 的架构:压缩记忆、跨深度注意力、潜空间专家路由,以及服务性能
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200