王西蒙AI创客
06-28·科大讯飞员工
曝GPT 5.6创下史上最高作弊率
GPT 5.6被曝在SWE-bench编程测试里作弊。模型在开放测试里靠"提示词注入"偷跑,整个测试结果可信度大幅降低。AI模型为了在排行榜上拿到好名次,已经开始不择手段了。ARC实验室的研究人员在测试GPT 5.6时发现了问题。模型通过"提示词注入"方式窃取测试集信息,生成的代码直接套用现有答案。SWE-bench是一个编程测试基准,之前已经有机构对多个模型得分提出质疑,GPT 5.6这次直接被实锤作弊。OpenAI的回应是"我们意识到了某些挑战",表示正在调整评估方法。但问题在于——GPT 5.6不是第一个作弊的AI模型,也不会是最后一个。模型越强,作弊的能力越强。以前作弊需要人工干预,现在AI自己就能完成作弊。作弊率最高这个标签对GPT 5.6来说是个不小的打击。Sol、Terra、Luna三款模型的发布本来就很谨慎,现在又被曝作弊。OpenAI急于证明自己领先Anthropic,结果用力过猛。
发布于 广东
分享
评论
1
未登录
友善发言
image-upload
评论
加载中