微学AI
07-14·AI领域创作者
斯坦伯格:AI的新瓶颈是注意力
稀疏注意力,注意力瓶颈的"逃生舱"
如果O(n²)是天花板,是不是只能认命?2026年这个赛道开始出现几种"破壁"思路,我个人最看好的是稀疏注意力的工程化落地。第一条路是Stanford团队提的Simplified Sparse Attention(SSA),核心是用"要点标记"——给每16个token插入一个学习出来的gist token,强制后续内容只能通过它来访问原文。这样模型被迫学会"做笔记再精读",推理时只要扫一遍gist就能定位重点,KV cache占用直接砍掉46-57%。这个方案最牛的地方是不用改模型架构,对已经训好的base model非常友好。第二条路是DeepSeek在V4里推的DSA(DeepSeek Sparse Attention),配合一个轻量的Lightning Indexer预筛top-k相关token,把注意力从全连接变成"按需连线"。我自己在跑Llama 3.1 8B长文档摘要时用过类似方案,效果立竿见影——prefill阶段能加速3-4倍,内存几乎减半。第三条最激进,是迈阿密一家叫Subquadratic的创业公司做的SSA——别和Stanford那个同名了——通过内容相关selector把注意力从n×n降到n×k。Appen独立测试显示1M token推理只用了381ms,对比FlashAttention-2的21411ms,56倍加速,听起来像在吹牛。但他们MRCR v2的实验室和产线分数差17-20个点,说明稀疏不等于无代价,召回率和精度的trade-off还得再磨。我觉得未来12个月,决定一家厂商长上下文排名的不是"窗口多大",而是"在多长上下文里还能保持高精度注意力"。
发布于 福建
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn