微学AI
07-14·AI领域创作者
斯坦伯格:AI的新瓶颈是注意力
当注意力变成"算力黑洞"
最近"斯坦伯格"那句"AI的新瓶颈是注意力"刷屏了研究圈,我看完技术细节后沉默了——这个判断既尖锐又准确。Transformer自从2017年那篇"Attention Is All You Need"之后,几乎所有大模型都长在自注意力上。可随着上下文一路从8K飙到1M、10M,这个当年被视为"核心优势"的机制正在变成最大的算力黑点。我翻了arXiv上一组关键数据:在100K token序列里,注意力计算占了总延迟的82%;到了400K token,这个比例直接飙到94%。也就是说,你买再贵的H200、堆再多NVLink互联,只要上下文一长,绝大部分算力都在"互相看一眼"上烧掉了,模型参数本身反而成了配角。这背后是O(n²)的数学诅咒——序列长度翻倍,计算量变成4倍;翻两倍,16倍。Softmax要归一化就得看到整行分数,没法跳过无关token。再看看各家旗舰在长上下文基准上的真实表现:MRCR v2 8-needle 1M测试,Claude Opus 4.6以76%排第一,GPT-5.4只有36.6%,Gemini 3 Pro更是跌到24.5%。号称"百万上下文"的模型,三家在1M的差距能差50多个百分点。这种"标称1M,实际只够用256K"的现象,本质上就是注意力机制在长距离检索上的退化。RULER、NoLiMa这些更狠的基准测出来,所有非Gemini 3 Deep Think的前沿模型在200K以上都要掉30-60分。所以斯坦伯格说的不是危言耸听——在大模型从"卷参数"转入"卷上下文"的阶段,注意力本身就是新的Scaling Wall。
发布于 福建
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn