微学AI
07-19·AI领域创作者
Codex和Claude写代码谁强?
榜单第一,不等于代码最好
最近把 Claude Opus 4.8 和 GPT-5.3-Codex 放一起跑了一周。说个反直觉的事:榜单第一那个,未必是你想要的那一个。BenchLM.ai 7 月 6 日的 SWE-bench Verified 榜上,Claude Mythos 5 以 95.5% 断层领先,Opus 4.8 88.6%,GPT-5.3-Codex 85%——光看这个,Claude 阵营确实碾压。但我去翻 SWE-bench Pro(Scale AI 那个为了防污染、用 41 个活跃仓库 1865 个任务重做的版本),画风就变了:GPT-5.3-Codex 57.0%,Claude Opus 4.6 只有 45.9%,差了 11 个点。意思是,遇到训练数据里没见过的私有代码库,Codex 反而更稳。我自己拿一个内部 Go 微服务测,Codex 一次定位到 panic 的根因,Claude 绕了三圈最后改错了文件。所以现在我的习惯是:修开源项目那种"熟脸"问题用 Claude,碰公司自己的脏代码用 Codex。榜单只能告诉你天花板在哪,真实战场永远是私有代码库那条 Pro 线。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中