小i学长说人力
06-27·招聘HR·5年+
DeepSeek发布DSpark提速60%
最近AI圈有个挺实在的消息,DeepSeek和北大联手开源了个叫DSpark的推理加速框架,主打就是把大模型生成速度拉起来。简单说,他们没换底层模型,就是搞了套新的推测解码方案。核心玩法是用轻量级草稿模型先“猜”一串token,再用大模型批量验证,猜对的就直接过,不用一个字一个字死等。这次DSpark具体做了两个事:一个是搞了半自回归生成架构,在并行猜词的基础上加了个轻量串行模块管上下文依赖,让草稿猜得更准,解决以前并行草稿后面容易乱码的问题;另一个是上了置信度调度验证,系统会根据GPU实时负载动态掐掉那些大概率过不了的尾部token,不做无用功。落地效果比较直观。现在已经部署在DeepSeek-V4系列的线上服务里了。官方数据是,在保证系统总吞吐量不掉的前提下,单用户感知的生成速度提升了60%到85%(Pro版也有57%-78%)。等于说并发高的时候也不卡了,还顺带把推理成本压下来了。配套还开源了一个叫DeepSpec的训练工具链,代码都在GitHub上了,不光能跑DeepSeek自己的模型,像Qwen、Gemma这些主流架构也能适配用。属于是纯工程侧的优化,没改模型智商,但体感流畅度确实上去了。
发布于 河南
分享
评论
3
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn