推理服务
EAGLE
也称为 EAGLE 投机解码、EAGLE-3
先用大白话
EAGLE 是一种为主模型起草多个可能后续 token 的方法,可让答案流式输出得更快。
技术定义
EAGLE 是一类投机解码方法:它根据与目标语言模型相关的特征预测 draft 序列,再交由目标模型验证。
工程细节
推理框架通常提供投机步数、draft token 数和候选宽度等参数来配置 EAGLE。模型 checkpoint、draft 组件和引擎实现必须相互匹配。
为什么重要
EAGLE 可以增加目标模型每一步接受的 token 数,但实际效果取决于工作负载。接受情况、draft 开销、模型架构和 batch 大小,共同决定这条额外路径能否提升端到端服务性能。
如何在 InferenceX 中解读
部分 InferenceX 曲线将这一功能标记为 MTP,因为模型提供多 token 预测头,而引擎使用的是 EAGLE 风格的投机解码管线。具体实现以测试配置中的 flags 和 checkpoint 详情为准。
参考资料
在真实基准中理解这一概念
B200 NVFP4 对比 H200 FP8 运行 GLM-5:SGLang MTP 下性价比提升高达 3.65 倍
两款 GPU 均运行 SGLang EAGLE MTP;Blackwell 世代在峰值处带来约 1.2 倍的性价比提升,NVIDIA GLM-5-NVFP4 检查点搭配 FlashInfer TRT-LLM 稀疏 MLA 在 8K/1K 场景下再叠加约 2.4–3.0 倍优势
DeepSeekV4 1.6T 第0天至第43天性能演进 — Huawei、GB300 NVL72、MI355X、B200
第0天推理性能、InferenceX、26天内性能提升100倍、每百万 token 成本、Huawei 950DT 推理 Trace 分析