数据与AI爱好者
06-28·北京深思致远科技有限公司员工
AI创作者AMA知无不言
DeepSeek开源极致提神推理速度方法
为什么 AI 回复总是一点一点往外蹦?原因在于大语言模型采用自回归生成:每生成一个 token,都要重新计算上下文,再决定下一个 token,就像写一句话,每写一个字都要从头读一遍,因此推理速度受到限制。目前主流的加速方法叫投机解码(Speculative Decoding)。它的思路类似于"学生先写、老师审核":一个速度很快的 Draft 模型先预测一串内容,再由更强大的 Target 模型一次性验证。验证通过的直接保留,错误的再修正,从而实现批量生成,大幅降低延迟。不过,现有方案各有不足。自回归 Draft(如 Eagle3)预测准确,但自身也较慢;并行 Draft(如 DFlash)速度极快,却缺乏前后文关联,越往后预测越容易出错,导致大量内容被主模型否决,影响整体加速效果。DeepSeek 与北大提出的 DSpark,正是为了兼顾速度与准确率。它采用半自回归(Semi-Autoregressive)架构:保留并行生成的高速优势,同时增加一个轻量级顺序模块,为预测结果补充上下文依赖。实验表明,仅增加约 0.2%~1.3% 的计算开销,就能让平均接受长度提升约 30%。DSpark 的另一项创新是置信度调度(Confidence Scheduling)。系统会预测每个候选 token 被接受的概率,并根据当前算力负载动态决定验证多少内容:资源充足时多验证,提高速度;资源紧张时只验证最有把握的部分,让更多用户获得稳定响应。实际效果也非常亮眼:相比 Eagle3,DSpark 的接受长度提升约 30%;相比 DFlash 提升约 18%。在 DeepSeek-V4 中部署后,用户感知速度提升 60%~85%,系统吞吐量提升 51%~52%。更重要的是,DSpark 是一种无损加速技术。最终输出仍由原始大模型验证,因此回答质量不会下降,生成结果与未使用投机解码时保持一致,只是响应速度更快。目前,该方案已经应用于 DeepSeek-V4 预览版,并在 Qwen3、Gemma4 等模型上完成验证,训练代码和模型也已开源。DSpark 并没有改变大模型的能力,而是优化了推理过程,让同样的模型、同样的答案,以更低的成本、更快的速度交付给用户。这也是当前大模型推理优化的重要方向之一。
发布于 北京
1
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn