微学AI
08-03·AI领域创作者
Codex和Claude写代码谁强?
SWE-bench差0.9%,但不一样
上个月脑子一热同时买了Claude Code和Codex的订阅,同一个项目轮着刷了一个多月。benchmark上两家咬得很紧,SWE-bench评测Claude拿了88.6%,Codex 87.6%,差0.9个百分点,纸面上基本算打平。但写代码不是做选择题啊。我手头这个项目业务逻辑比较绕,Claude首轮就能把需求吃透直接出活的概率明显更高,我自己估着有八成以上;Codex碰到这种活就差点意思,经常要来回调两三轮。不过反过来,有次我重构了十几个文件的import路径,Codex一遍过,Claude反而在中间卡了一下。还有个事挺说明问题的:同样的活Codex大概吃13万多token,Claude奔着20万去了。Claude多花的算力倒也没白费,它自己会偷偷跑冒烟测试,抓bug确实更准。Codex呢,测试数量堆得多,当第一轮回归用挺好。说白了这俩路子不一样,Codex像干活利索的外包,任务明确就猛冲;Claude像个爱多想的老同事,偶尔会跟你说"等一下,你这个需求本身有问题"。
发布于 福建
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn