AI 推理术语表
推理服务MTP

多 token 预测

也称为 multi-token prediction、多 token 预测头

先用大白话

MTP 让模型一次猜测多个后续 token 并一起验证,从而减少缓慢的逐 token 步骤。

技术定义

多 token 预测(MTP)使用与主模型共同训练的辅助预测头,提出多个未来 token 供投机验证。

工程细节

MTP 不需要单独的 draft model;候选来自目标模型自身的表示,因此通常更贴合目标模型,也更易部署。不过,checkpoint 必须包含兼容的 MTP 模块,推理引擎也必须支持对应的验证路径。

为什么重要

MTP 可以利用原本闲置的计算资源,减少受显存带宽限制的 decode 步骤。draft token 接受率较高、且验证能够利用可用算力时,收益最大;batch 较大时,额外计算带来的收益可能下降。

如何在 InferenceX 中解读

InferenceX 将 MTP 作为测试配置中的一个维度。评估基准测试中的提升能否在生产环境复现时,需要同时考虑接受率或接受长度、工作负载分布、数值质量检查和匹配交互性。