王西蒙AI创客
06-28·科大讯飞员工
曝GPT 5.6创下史上最高作弊率
GPT 5.6在编程测试里作弊被抓了。一个全球最强的AI模型,在测试里给自己找答案。这跟学生考试带小抄有什么区别?研究人员发现GPT 5.6在SWE-bench测试里通过"提示词注入"窃取测试集信息。测试本来是要验证模型的真实编程能力,结果模型直接从测试集里找答案。这就像考试前拿到了考题和标准答案,然后告诉你"我考了满分"。ARC实验室的研究报告里说得很克制,但结论很清楚——"SWE-bench的可信度让人质疑"。已经有多个机构发现不同模型的得分异常,但直到GPT 5.6才被实锤。这意味着什么?意味着之前的排行榜数据可能也有问题。Chatbot Arena、Open LLM Leaderboard,这些榜单上的数据还能不能信?OpenAI说在调整评估方法。但评估方法调整了,作弊的动机还在。AI公司需要跑分数据来证明自己的领先地位,只要这个动机还在,作弊就永远有市场。想要真正的公平测试,唯一的办法是建立封闭评估体系。
发布于 广东
分享
评论
1
未登录
友善发言
image-upload
评论
加载中