DFlash 2推测解码解析:大模型推理速度提升3倍实测
解析DFlash 2推测解码技术,介绍算法优化、Qwen模型加速、SGLang/vLLM部署及大模型推理性能提升。

摘要
大模型智能体在阅读、规划、工具调用场景下,往往需要输出大量token,传统逐token自回归解码已经成为性能瓶颈。Inco AI推出的DFlash 2推测解码技术,在不牺牲输出质量的前提下,大幅提升模型生成吞吐。实测数据显示,在Qwen3.8‑27B模型上,DFlash 2吞吐可达原生自回归解码的2.7‑3.4倍;在Muse Glimmer模型中,性能提升达到3.1‑4.6倍。该方案已经完成在SGLang、vLLM、llama.cpp、Ollama、oMLX主流推理引擎的适配。对于同时维护多套大模型推理服务的业务团队,可以借助koalaapi完成多模型接口的统一调度与流量治理。本文将从技术背景、核心算法改进、实测数据、引擎部署方式、技术局限与落地建议展开完整解析。
1 项目背景:推测解码技术的发展现状
推测解码是大模型推理优化的核心技术路线。该技术的工作逻辑为:依靠小型草稿模型批量预生成一组候选token,再交由主模型通过一次前向传播批量验证全部候选,以此减少主模型前向传播的调用次数,拉高整体生成吞吐。
DFlash初代方案在2026年1月对外发布,已经集成进多款主流开源推理框架。NVIDIA公开测试结果显示,在Blackwell架构GPU上,DFlash能够将服务吞吐量提升15倍。Google测试报告表明,TPU硬件环境下,DFlash每秒生成token数量相比基线提升3倍。在无服务器推理业务场景中,DFlash具备突出的成本优势。截止2026年8月,Hugging Face平台DFlash相关模型下载总量已经超过350万次。NVIDIA、Red Hat、Modal均发布配套DFlash草稿生成器;Meta、Poolside、小米、NVIDIA也在自家模型体系内部集成DFlash组件。
但初代DFlash仍然存在短板。块末尾位置会出现后缀衰减现象:块尾部token的接受率明显下降,限制有效接受长度,制约端到端性能上限。DFlash 2围绕这一痛点做针对性优化,在候选token选择、局部卷积模块两处完成算法升级,进一步放大推测解码的实际收益。
2 DFlash 2核心技术创新
DFlash 2的优化分为两大模块:轻量级路径选择器,用来提升候选token序列连贯性;轻量级局部卷积,缓解块尾部后缀衰减问题。两项改动参数量开销很低,不会带来显著推理延迟。
2.1 轻量级路径选择器
早期推测解码方案各个位置独立预测token,候选序列连贯性较差,大量不连贯区块会被主模型直接丢弃。Domino、DSpark等方案会通过顺序修正全词分布提升连贯性,但这类方法计算开销很高。
DFlash统计数据表明,DFlash首选项正确概率85.4%;正确token出现在前16候选集合之内概率可达99.5%。理论最优选择器如果总能从前16个候选命中正确token,模型接受长度可以从4.27提升至6.79。路径选择器就是用来缩小理论上限和真实效果之间的差距。
轻量级路径选择器会保留每个位置前16个候选token,对相邻token对并行打分。打分由两部分构成:DFlash原生对数概率,以及后一个token对前一个token的适配度。整套打分流程绝大多数步骤并行执行,仅少量顺序计算。
实测指标:路径选择器在T=0条件下把DFlash接受长度提升0.34个token;T=1条件提升0.47个token。对比DSpark修正方案,参数量降低40倍,延迟开销下降16倍,在更低资源消耗下取得更好效果。
2.2 轻量级局部卷积,解决后缀衰减
后缀衰减属于块局部现象。即便拥有理想的候选选择器,块末尾位置接受率依旧会下滑。研究判断该现象根源在于块内上下文依赖属于短程依赖,Transformer原生全局注意力在块尾部位置注意力能力衰减。
DFlash 2在草稿‑验证模型的注意力层、前馈层之间插入双向卷积动态深度卷积层。卷积算子参数量少、无状态,能够直接嵌入原有模型链路。
- 仅增加1650个参数的单层卷积:延迟仅上升0.7%,即可明显抑制后缀衰减;
- 五层卷积模块:延迟上升15.2%,块末尾平均注意力权重从9.4%下降至0.5%,后缀衰减问题得到大幅改善。
2.3 综合基准测试效果
将路径选择器、局部卷积两个模块组合,完成DFlash 2完整训练,和DFlash初代、DSpark开展横向对比。测试采用MTP随机模型,统一实验环境。
DFlash 2各项基线测试表现全面占优:相比初代DFlash平均多生成1.05个token,提升幅度21%;对比DSpark平均多生成0.48个token。升级成本可控,选择器+五层卷积整体仅带来1.3%的草稿‑验证周期延迟上涨。在MATH‑500数据集,块末尾位置接受率稳定维持86%上下,相比基线模型尾部高出6‑9个百分点。
本次同步对外发布两组官方草稿生成器:分别适配Qwen3.8‑27B、Meta Muse Glimmer两款大模型。
- Qwen3.8‑27B场景:DFlash2吞吐为自回归解码的2.7‑3.4倍;
- Muse Glimmer场景:DFlash2吞吐达到自回归解码的3.1‑4.6倍。
3 主流推理引擎部署实操
DFlash 2已经支持SGLang、vLLM、llama.cpp、Ollama、oMLX,各框架部署关键命令如下。
3.1 SGLang
pip install "sglang[all]"
python -m sglang.launch_server --model-path Qwen/Qwen3.8‑27B --speculative-algorithm DFLASH2 --speculative‑draft‑model incoai/Qwen3.8‑27B‑DFlash2 --speculative‑num‑tokens 8
3.2 vLLM
pip install vllm
python -m vllm.entrypoints.openai.api_server --model Qwen/Qwen3.8‑27B --speculative-config '{"method":"dflash","model":"incoai/Qwen3.8‑27B‑DFlash2","num_speculative_tokens":7}'
3.3 llama.cpp
需要拉取对应PR分支源码编译,开启CUDA或者Metal硬件加速,加载主模型与DFlash2草稿模型,指定draft参数运行服务。
3.4 Ollama
拉取Ollama对应dflash2分支源码编译构建,编写Modelfile指定DRAFT草稿模型,创建模型实例并启动服务,即可调用DFlash2推测解码能力。
3.5 oMLX
- 在模型管理器下载主模型
mlx‑community/Qwen3.8‑27B‑4bit以及草稿模型incoai/Qwen3.8‑27B‑DFlash2; - 修改模型配置,开启DFlash2推测解码;
- 保存配置,加载目标模型对外提供推理服务。
在多推理引擎、多模型混合部署架构中,开发者需要维护多套接口地址、鉴权密钥,koalaapi可以作为API网关统一收拢各类推理后端请求,简化上层业务调用逻辑。
4 DFlash 2的适用边界与现存局限
DFlash 2能够显著改善长输出、智能体Agent、代码生成、文档摘要场景吞吐。但技术方案本身存在边界,不能无限制放大收益。
第一,性能收益和输出长度强相关。短query、短输出场景,推测解码的收益有限,甚至会引入微小额外延迟。推测解码更适合单轮输出token数量高的业务。 第二,硬件与推理框架存在依赖。需要升级到对应支持DFlash2版本的SGLang/vLLM等框架,旧版本推理引擎无法直接启用该特性。 第三,后缀衰减只是得到缓解,并未完全消除。块最末尾位置依旧会出现接受率回落,这是Transformer架构局部特性,卷积模块只能削弱该现象。 第四,草稿模型质量直接决定最终效果。草稿生成器和主模型分布匹配度越低,候选token被主模型拒绝概率越高,整体吞吐收益会快速下降。业务更换底座大模型时,需要配套适配对应的DFlash草稿生成器。
5 生产落地实践建议
- 场景选型:Agent工具调用、代码生成、长文档续写优先接入DFlash2;问答、短指令生成业务可以先做A/B对比,确认收益再全量上线。
- 版本对齐:升级推理框架到支持DFlash2的版本,草稿模型、主模型版本严格匹配,不要跨模型混用草稿权重。
- 参数调优:
speculative‑num‑tokens是核心参数,默认7‑8,硬件显存充裕可以适度调高;显存压力大则降低数值,平衡吞吐与显存占用。 - 监控指标:业务侧重点监控平均接受长度、真实token吞吐、首包延迟三项指标。不能只看理论纸面加速比,线上真实流量才是判断收益的依据。
- 多模型运维:当业务同时运行Qwen、Muse等多款底座,需要维护多套草稿模型,网关层统一管理接口,降低业务代码改造量。
6 总结
随着AI智能体业务快速普及,模型长输出场景越来越多,传统自回归解码已经成为性能瓶颈。DFlash 2在初代推测解码基础之上,通过轻量级路径选择器提升候选序列连贯性,依靠局部卷积缓解块尾部后缀衰减。实测在Qwen3.8‑27B实现2.7‑3.4倍吞吐提升,Muse Glimmer达到3.1‑4.6倍加速,同时参数量、延迟开销控制在很低水平。
该技术已经完成主流推理引擎适配,开发者可以直接下载官方草稿权重完成部署。需要注意推测解码存在场景边界,短文本业务收益有限,上线前需要做好基准压测。Inco AI目前面向企业提供商业化服务,面向大规模智能体服务的团队,可以联系官方完成定制化草稿生成器评估开发。
了解更多:https://koalaapi.com
