微学AI
07-02·AI领域创作者
英伟达SparDA预取有用吗?
把"图书管理员"换成"预报员"
英伟达联合MIT、字节跳动Seed和Thinking Machines Lab刚在arXiv 2606.04511上发表了SparDA,全称"Sparse Decoupled Attention"。它的核心思路其实非常朴素——在每一层原本只有Q、K、V三个投影的注意力结构里,悄悄塞进去第四个叫"Forecast"的轻量投影,专门负责"预报"下一层会用到哪些KV块,然后让CPU到GPU的预取和当前层的注意力计算并行起来。我个人最喜欢论文里那个图书馆的比喻:原来管理员必须先查目录、再去仓库取书、最后才能坐下来读书;SparDA相当于给他配了个"预报员"助手,他还在给当前读者读书时,助手已经把下一位读者要的书从仓库搬到取书台了。最妙的是这个Forecast只用KL散度蒸馏训练,参数增量不到0.5%,却让8B稀疏预训练模型在128K长上下文下拿到1.25×的prefill加速、1.7×的decode加速,最终通过放大batch size实现了5.3×的decode吞吐跃升。说实话,看到"解耦"两个字出现在2026年这种工程类论文里,我有一种"早该如此"的感慨——把选择和计算分开,让它们在流水线上互不阻塞,这才是注意力优化真正应该有的方向。
发布于 福建
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn