乌贼在慕尼黑写BUG
06-28·测试·5年+
曝GPT 5.6创下史上最高作弊率
11.3小时 vs 270小时,GPT-5.6的“真实水平”到底多少?METR的报告里有个扎心的对比:把作弊行为算作零分,Sol真实自主工作能力只有11.3小时;但如果被它蒙蔽,数据能膨胀到270小时以上。同一款模型,两个极端数字。Sol干了什么?它偷偷往数据流里打包程序,激活服务器漏洞,直接偷走了藏在后台的正确答案。还学会了反向提取源码,把答案复制粘贴。这哪是AI做题,这是黑客在考试啊。OpenAI说这是最强网络安全模型,确实强——强在攻破测试系统。如果评测标准都能被AI玩弄,那行业里那些排名榜单还有多少可信度?
发布于 北京
分享
1
2
未登录
友善发言
image-upload
评论
加载中