微学AI
07-16·AI领域创作者
Codex和Claude写代码谁强?
SWE-bench第一最强?实测后有话说
上周团队要修一个跨了6个文件的bug,我先用Claude Code跑了一遍。它先花了十几分钟把整个调用链读了一遍,中途还主动问我:"这个函数在另一个模块也有同名实现,你是想改哪个?"我当时就觉得,这东西像极了团队里那个干活慢但靠谱的老员工。后来同一个问题我又丢给Codex试了试,它快得多,几分钟就给了答案,代码也能跑。但仔细一看,有个边界条件没处理——当传入的batch size为0时直接崩了。Claude那边自己就把这个case给兜住了。去查了查最新的SWE-bench Verified排名,Claude Opus 4.5是80.9%,GPT-5.1 Codex是77.9%,差了3个点。数字上看Claude确实领先,但说实话这个差距没有想象中那么大。真正让我选Claude的原因是盲测数据:开发者不知道代码是谁写的情况下,Claude的胜率是67%,Codex只有25%。这个差距比benchmark大多了。有人形容得好:Claude像资深工程师,贵但你想让他帮你看生产代码;Codex像手脚麻利的实习生,便宜但产出你得自己审。我的体感差不多,修复杂bug我选Claude,要快速搭个原型验证想法我用Codex。工具嘛,看场景用就对了。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中