AI 推理术语表
推理服务

投机解码

也称为 speculative decoding、草稿与验证解码

先用大白话

投机解码先让成本较低的辅助模块提前生成多个 token,再交给完整模型一次性验证,从而减少逐个生成的步骤。

技术定义

投机解码先以较低成本生成多个候选 token,再由目标模型批量验证,从而减少成本较高的串行 decode 步骤。

工程细节

draft model 或内置预测头会生成候选 token,目标模型再通过一次批量验证评估这些候选,并接受其中有效的连续前缀。只要算法实现严格,目标分布就不会改变。

为什么重要

加速取决于草稿 token 的接受数量,以及草稿与验证成本。稠密模型和 MoE 的表现可能不同,因为验证多个位置可能激活更多专家权重。

如何在 InferenceX 中解读

在固定序列场景中,投机解码属于曲线标识的一部分,因此启用和未启用 MTP 的测试配置会分别绘制。Agentic 曲线则将投机解码作为数据点级元数据,并将这些点合并到同一条曲线中;每个提示框仍会注明具体方式。这是因为 AgentX 按模型、芯片 SKU 和引擎展示可达到的最佳曲线。由于 AgentX 回放使用合成内容,speculator 接受的 draft token 数并不具有代表性,因此运行时会使用从外部 agentic 编码数据集采集的接受长度,并按模型、speculator、draft 长度和思考模式分别配置。