正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
推测解码通过轻量草稿模型与目标模型验证解耦来加速推理。并行草稿模型虽单次前向即可生成长候选块,但因各位置独立预测,缺乏块内 token 依赖,导致后缀接受率快速衰减;同时在高并发服务中,无差别验证长块会占用关键批处理容量,严重拖累系统吞吐。如何在保持并行生成高吞吐的同时提升草稿质量,并根据系统负载自适应选择验证长度,是本文要解决的核心问题。
核心方法
DSpark 采用半自回归架构:并行骨干(基于 DFlash)一次前向生成整个块的隐状态与基础 logits,随后轻量顺序模块(Markov head 或 RNN head)以自回归分解方式注入前缀依赖的转移偏置,缓解后缀衰减。置信度头预测每个位置在前缀已被接受条件下的存活概率,并通过序列温度缩放校准。硬件感知前缀调度器结合引擎吞吐曲线与请求级存活概率,贪心选择验证长度以最大化系统级 token 吞吐,同时通过早停机制保证非预期性。
实验结论
- 离线在 Qwen3-4B/8B/14B 上,宏平均接受长度较 Eagle3 提升 26.7%–30.9%,较 DFlash 提升 16.3%–18.4%。
- 线上 DeepSeek-V4 部署中,匹配吞吐下单用户速度提升 60%–85%(Flash)与 57%–78%(Pro),并在严格 SLA 下避免吞吐断崖。
适合谁阅读
关注 LLM 推理加速推测解码高并发服务系统优化的研究者与工程师系统基础设施推理与规划
可核验的原论文来源和作者
- 作者
- Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, Qinyu Chen, Chengqi Deng, Jiping Yu, D...
- 来源
- arXiv
- 论文 ID
- 2607.05147