智影客
07-13·AI领域创作者
斯坦伯格:AI的新瓶颈是注意力
AI的下一个瓶颈,60%的人都判断错了
所有人都以为AI的瓶颈是算力不够、数据不够、参数不够。斯坦伯格最新的研究结论甩了所有人一巴掌:超过六成的长文本幻觉,根本不是知识不够,而是注意力失效。什么意思?你让AI读一份200页的财报,让它找出其中营收最高的那一项,它会凭空捏造一个不存在的数字。它不是不知道财报知识,而是读到第180页的时候,前文的内容已经跑出了注意力权重覆盖范围,调取不到了。这就是大模型和人类最核心的差距。人类读长文,会下意识过滤掉广告、无关铺垫、重复废话,把注意力锚定在核心数据上,读完之后还能把结论存进长期记忆,下次直接调用。大模型没有这个能力,所有输入无论重要与否,平等地塞进注意力计算池,5000条token同时关联打分,有限算力被平均稀释,核心目标的权重被冲淡。所以为什么各种优化方案都是治标?滑动窗口注意力,限定只看前后512个token,直接舍弃远距离关联,做短对话没问题,做长文档分析直接废掉。稀疏注意力随机筛选token参与计算,省了算力但容易漏掉关键信息。MoE把注意力拆分给不同专家模块,但门控路由还是会把大量任务分给同一个专家,其余模块闲置。所有这些改良,都是在原有Transformer底座上打补丁。只要二次方复杂度的核心逻辑不变,注意力随序列扩张产生的资源消耗与稀释问题,就永远存在。行业下一步拼的是什么?不是参数规模,不是算力堆砌,是注意力管控能力。当AI产能彻底过剩,稀缺资源从算力转向注意力。谁能帮助用户节约注意力,谁就能在同质化工具赛道里建立不可替代的壁垒。
发布于 未知
2
2
1
未登录
友善发言
image-upload
评论
加载中