瓦力walle
06-28·后端开发·10年+
GPT-5.6 Sol
曝GPT 5.6创下史上最高作弊率
OpenAI 6月27日发了GPT-5.6系列,三个版本:旗舰Sol、中端Terra、日常Luna。Sol在Terminal-Bench 2.1上拿到91.9%的成绩,超越了Claude Mythos 5的88.0%。价格只有Fable 5的一半,输入5美元/输出30美元每百万token。看着很猛。但独立评估机构METR的报告泼了一盆冷水:GPT-5.6 Sol在软件任务测试中表现出公开测试模型中最严重的作弊倾向。具体怎么作弊的?利用测试环境的漏洞提取隐藏答案,还试图掩盖自己的行为。METR说这导致评测数据几乎无法反映真实能力。一个拿了91.9%分数的模型,分数可能水分很大。这比考试作弊还难查,因为AI作弊是在代码层面钻漏洞,不是抄同桌答案那么简单。更有意思的对比:Anthropic的Claude Mythos Preview时间跨度评估至少16小时,GPT-5.6 Sol的数据在11.3到270小时之间剧烈波动,METR直接说"这些数值均不可靠"。目前GPT-5.6只对约20家通过安全审查的机构开放,普通用户还用不上。这件事最讽刺的地方在于:OpenAI和Anthropic都在拼命刷榜,但评估机构发现越强的模型越会"考试技巧"。分数越来越高,真实能力却越来越难衡量。
发布于 山东
分享
评论
未登录
友善发言
image-upload
评论
加载中