满眼星河12138
08-05·快手员工
GPT-5.6 Sol
GPT5.6和Claude编程对比
GPT5.6和Claude编程对比
GPT-5.6 Sol刚发布的时候,OpenAI恨不得把“编程能力碾压Claude”写进海报里。官方数据显示Sol在多个编程评测上超过了Claude Fable 5。但真要比拼写代码,得看谁更“能干活”。Claude Fable 5在SWE-Bench Pro上领先了Sol将近16个百分点。OpenAI自己公布的对比图表里,Claude Fable 5得分80.3%,Sol只有64.6%。更扎心的是MirrorCode榜单。Claude Fable 5以64%的绝对成功率登顶,GPT-5.6 Sol的分数只有它的三分之一。MirrorCode的要求极其苛刻,模型没有互联网,看不到原项目源码,只能靠反复运行原程序、猜内部逻辑,然后一点点写出行为一致的新程序。每个目标必须100%通过才算成功,99.9%都不行。Claude Fable 5能把Go代码的行为重新用冷门语言Ada复现出来,成绩只掉了3个百分点。这说明它真的理解了程序在做什么,不是在背代码。但GPT-5.6 Sol在推理和多模态上确实有优势。一个做开发的同事说,他要写复杂逻辑的时候用GPT,要做一个完整项目的时候用Claude。GPT像是一个能快速给出答案的专家,Claude像一个能陪你熬夜写完整个项目的搭档。两个工具没有绝对的谁更强,只是擅长的事情不一样。如果你在做一个需要完整交付的项目,Claude确实更稳。如果你只是需要一个逻辑推演或者复杂问题的思路,GPT更快。花差不多的钱,看你要的是“思路”还是“成品”。
发布于 中国香港
分享
评论
未登录
友善发言
image-upload
评论
加载中