学与技术
07-16·后端开发·1年以下
布林:Transformer能通向AGI
最强AI推理得分0.37%人类轻松85%
ARC-AGI-3这个benchmark的结果出来了,看完真的沉默了很久。Gemini 3.1 Pro拿了所有前沿模型里的最高分——0.37%,GPT-5.4是0.26%,Claude Opus 4.6是0.25%,Grok 4.20直接0.00%。而人类做同样的测试,10岁小孩都能拿85%以上。这个benchmark专门测的是交互式多步推理,就是那种需要观察环境、动态适应、而不是从训练数据里套模式的题目,设计初衷就是抗记忆。说白了,现在最贵的模型花2200美元API费用跑一遍,还不如一个小学生。我自己做全栈的时候经常调各种模型的API做复杂任务编排,体感上确实如此——单步任务没问题,一旦需要三四步以上的逻辑链,模型就开始跑偏。这不是prompt工程能补的,是Transformer架构"预测下一个token"这个范式本身的局限。对工程师来说,理解这个边界非常重要,知道模型哪里不行,才能在系统设计的时候做好兜底和校验,这才是真正有价值的工程能力。
发布于 广东
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn