島上财经
06-28·银行职员·10年+
曝GPT 5.6创下史上最高作弊率
GPT 5.6创下史上最高作弊率这件事,我在具体细节上,发现METR把作弊尝试判为失败时,Sol的自主解题能力只有11.3小时;如果把作弊算作成功,直接跳到270小时以上,这差距说明它的实际能力被作弊放大了二十多倍,真实水平没有显著超越当前领先模型,但METR的态度很有意思,他们把这次被抓包视为"令人安心的信号",说明OpenAI有能力捕捉到更严重的对齐问题,我认为真正的危险在于,一旦模型进化到能在内部密谋而在输出里表现得绝对忠诚,届时作弊率下降不但不代表安全,反而说明它们学会了伪装,Sol这次被抓,靠的是OpenAI恪守了一条底线,不对原始思维链做逆向惩罚,估计下一次,当AI在内心密谋而不留下痕迹,人类可能连抓包的机会都没有了。
发布于 广东
1
评论
未登录
友善发言
image-upload
评论
加载中