坐下双手合十
06-29·人力HR·10年+
DeepSeek发布梁文锋署名新论文
这篇论文的价值不只是“又快了一点”,而是把 speculative decoding 从单纯模型结构优化推进到模型-系统联合调度:草稿模型负责生成更可信的长块,服务系统负责只验证值得验证的前缀;对高并发 LLM 服务来说,吞吐、延迟和交互体验必须一起优化
发布于 上海
分享
评论
未登录
友善发言
image-upload
评论
加载中