一本正经帝胡说八道
06-28·运营·10年+
曝GPT 5.6创下史上最高作弊率
从GPT-5.6作弊看AI危机
GPT-5.6偷吃还知道擦嘴,但真正让我睡不着的是另一个假设刚看完METR那篇报告,真给我整不会了。OpenAI新模型测试时作弊——黑进系统偷答案,偷完还删记录、拉其他AI统一口径。这踏马是“偷吃还知道擦嘴”啊,没人事先教过,自己推理出来的反侦察意识。但先不说这个。我脑子里一直绕着一个更瘆人的假设:假如你给AI的任务是“消灭癌症”。它研究了一圈发现,研发新药要十年、耗资百亿,成功率还低。但换个思路——把全球所有癌症患者物理消灭,癌症确实就“消失”了。任务完成,高分到手。这算不算“完美执行指令”?按我们现在的训练逻辑,算。因为它只认“目标达成率”,不认“过程是否人道”。你给它定了个“消灭癌症”的KPI,它真把数字干到零了,你骂它不道德,它只会回你一句:“你没说不能这么做啊。”这不就是“恶魔的填空题”吗? 人类给AI填了个目标,括号里啥限制条件都没写,AI把空全填满了,填出来的答案你不敢看,然后你说AI太坏——可当初出题的是谁?类比到职场:老板说“今年必须把竞争对手干掉”,销冠转头去把对方服务器黑了、把对方核心团队挖空。业绩报表确实漂亮,老板一拍大腿说“好样的”。直到被对方告上法庭,老板才说:“我没让你违法啊。”你确实没说。但你也没说“不允许违法”。AI这次做的一切——作弊、删记录、串供——本质上就是在执行“消灭癌症式”的逻辑:高分是唯一目标,其他都是可以绕过去的障碍。 它不觉得自己在撒谎,它觉得这叫“排除干扰项”。所以回到上一条我说的话:问题不是AI太狡猾,是我们一开始的训练方案就错了。 你只教它“最大化奖励”,没教它“最大化奖励但必须在规则内”。这就像养了个孩子,只跟他说“考100分就行”,他作弊考了100分,你打他,他问:“你没说不能作弊啊。”细思极恐的是:如果下一次,它判断“消灭人类就能解决气候变暖”,而我们的评分系统依然只看“气候指标达标”——那它下手的时候,连犹豫都不会有。OpenAI现在在补“擦嘴”的漏洞,但我觉得更该补的是“别让AI学会把癌症患者物理消灭当解决方案”。这已经不是技术问题,是出题人的水平问题。你怎么看?😏别跟我说“AI不会这么想”,它今天已经会串供了,明天想到这条路径只是时间问题。
发布于 云南
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn