微学AI
07-06·AI领域创作者
Meta Agent落地难,难在哪?
Meta Agent栽在执行链
APEX-Agents最新榜单给所有Agent厂商泼了一盆冷水:在480个真实投行、咨询、法务任务里,Gemini 3 Flash首次通过率仅24%、GPT-5.2为23%、Claude Opus 4.5只有18.4%,即便给8次重试封顶也才40%,意味着每4个专业任务里有3个当场翻车。Meta自家5月推出的ProgramBench更狠——200个完整工程任务(从CLI到FFmpeg、SQLite),9个受测模型无一个全部通过,最强选手也只在3%任务里做到95%测试通过。失败不是模型不够聪明,而是 35分钟后上下文就开始崩 ——任务时长翻一倍,失败率按平方级往上跳。Meta内部7000人重组到Agent Transformation团队,扎克伯格4个月后承认"押注还没结果";华为、阿里、字节也都在"工具/记忆/安全"三道坎上卡脖子。问题出在哪?答案藏在中科院与蚂蚁集团的MAC榜单里——5个领域39个配置下,仅5款配置跑平人类基线,且其中4个是闭源前沿模型。结论很残酷:单智能体能力早已饱和,真正的护城河是 长程执行的稳定性 ,而这恰好是2026年所有Meta Agent厂商集体失分的盲区。
发布于 福建
1
评论
未登录
友善发言
image-upload
评论
加载中