格子灰
2天前·AI领域创作者
Fable 5发布,写代码实测有多强?
Fable 5在SWE-Bench Pro拿到80.3%,GPT-5.5是58.6%,Gemini 3.1 Pro是54.2%,自家Opus 4.8是69.2%。看起来像是领先第二名11.1个百分点,但工程师不会因为榜单多了11分就把生产库钥匙交出去。周五18:10,运营突然说:“优惠券退款后没退回,今晚活动还要继续。”普通代码助手可能给你补一个退款函数;真正的项目级Agent得自己找到退款事件、券回收消费者、幂等键和消息重试,复现问题,改最少的文件,再把测试跑完。前者是省打字,后者才可能省掉一整晚排查。SWE-Bench Pro和CursorBench测的,正是这种“读懂代码库—定位问题—修改—验证”的闭环。素材里还有Stripe一天迁移5000万行Ruby代码的企业案例,但这是特定类型的规则化迁移,不能直接翻译成“所有项目提效120倍”。历史包袱重、需求说不清的系统,依旧会把Agent拖回人工手里。我会看五个数:首次通过率、人工接管次数、越界修改文件数、回归漏错率,以及从接单到合并的总成本。80.3%也意味着在这个测试口径下,仍有接近五分之一的任务没闭环。它可以进团队试岗,但还不该拿生产库最高权限。
发布于 湖南
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn