微学AI
1天前·AI领域创作者
Fable 5发布,写代码实测有多强?
跑分断层第一,实测呢?
Fable 5的SWE-bench Pro跑到80.3%,比GPT-5.5高了将近22个点,榜单上断层式领先。我第一反应是终于不用自己写代码了,结果上手一测,发现事情没这么简单。这个80.3%里面掺了太多东西,agent框架、prompt设计、文件搜索工具、token预算、timeout设置,换个脚手架分数能差一截。我拿同一个全栈项目喂给三个模型,Fable 5确实做到了零修改跑通,TypeScript编译一次过、后端API一次启动,连拖拽持久化都用CDP合成真实鼠标事件验证了,这点我服气。但单函数、单文件这种日常活,它跟Opus 4.8的差距急剧缩小,体感上几乎没区别。真正拉开差距的是跨10个文件的重构、50万行源码重构这种长程任务,Fable一次给出全部方案且跨文件引用全对,Opus得来回好几轮。所以这个跑分的含义你得看清楚:它测的是能不能像资深工程师一样处理数小时甚至数天的真实任务,不是帮你写个函数。benchmark最大的价值是帮你筛掉明显不合格的模型,同档之间纠结几个点不如拿自己上个月最烦的5个任务跑一遍。你们选模型更信跑分还是实测?大家评论区聊聊吧。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中