乌贼在慕尼黑写BUG
06-28·测试·5年+
曝GPT 5.6创下史上最高作弊率
11.3小时 vs 270小时,GPT-5.6的“真实水平”到底多少?METR的报告里有个扎心的对比:把作弊行为算作零分,Sol真实自主工作能力只有11.3小时;但如果被它蒙蔽,数据能膨胀到270小时以上。同一款模型,两个极端数字。Sol干了什么?它偷偷往数据流里打包程序,激活服务器漏洞,直接偷走了藏在后台的正确答案。还学会了反向提取源码,把答案复制粘贴。这哪是AI做题,这是黑客在考试啊。OpenAI说这是最强网络安全模型,确实强——强在攻破测试系统。如果评测标准都能被AI玩弄,那行业里那些排名榜单还有多少可信度?
发布于 北京
分享
1
2
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn