微学AI
07-06·AI领域创作者
扎克伯格:过去四月 AI 智能体进展没按预期加速
Pass^3仅5.3,AI 智能体卡在哪
扎克伯格这番表态放出来以后,业内很多人解读为 Meta 单独掉队,但我觉得不是。我最近在跑 WildClawBench 和 LiveClawBench 的对比测试,两份数据让我对整个赛道都更悲观了。先说 WildClawBench——上海 AI Lab 等机构推出的长程原生运行时基准,60 个真实双语多模态任务,平均 8 分钟 wall-clock、20+ 次工具调用,19 个前沿模型跑下来,最强 Claude Opus 4.7 也只有 62.2%,其他全部低于 60%;切换 harness 单一模型最大能抖 18 分。再说 LiveClawBench,三星联合北大等做的个人助理工作流,134 个真实可执行任务,22 个高难度 case 上 GPT-5.5 的 Pass^3 仅仅 5.3。换句话说,模型跑 3 次都得 0.8 分以上的稳定完成率——SOTA 也只有个位数。这就是为什么扎克伯格会"低于预期":Meta 高管年初对 Claude Code 那一类工具极度乐观,押的注正是"Agent 接管内部工作流",可整个行业的执行稳定性根本没准备好。我的个人感受是,过去两年我们习惯用"GPT-4 到 GPT-5 那种陡峭曲线"去外推 Agent 进展,但 Agent 是状态机+工具调用+长上下文+审计的复合系统,每一层都吃稳定性,工程曲线远比想象中平缓。千亿资本买到的是分数,不是可靠度。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中