微学AI
07-06·AI领域创作者
Meta Agent落地难,难在哪?
Meta Agent栽在执行链
APEX-Agents最新榜单给所有Agent厂商泼了一盆冷水:在480个真实投行、咨询、法务任务里,Gemini 3 Flash首次通过率仅24%、GPT-5.2为23%、Claude Opus 4.5只有18.4%,即便给8次重试封顶也才40%,意味着每4个专业任务里有3个当场翻车。Meta自家5月推出的ProgramBench更狠——200个完整工程任务(从CLI到FFmpeg、SQLite),9个受测模型无一个全部通过,最强选手也只在3%任务里做到95%测试通过。失败不是模型不够聪明,而是 35分钟后上下文就开始崩 ——任务时长翻一倍,失败率按平方级往上跳。Meta内部7000人重组到Agent Transformation团队,扎克伯格4个月后承认"押注还没结果";华为、阿里、字节也都在"工具/记忆/安全"三道坎上卡脖子。问题出在哪?答案藏在中科院与蚂蚁集团的MAC榜单里——5个领域39个配置下,仅5款配置跑平人类基线,且其中4个是闭源前沿模型。结论很残酷:单智能体能力早已饱和,真正的护城河是 长程执行的稳定性 ,而这恰好是2026年所有Meta Agent厂商集体失分的盲区。
发布于 福建
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn