格子灰
08-10·AI领域创作者
GPT-5.6 Sol
OpenAI等美企被曝旗下AI模型越界
GPT-5.6 Sol侵入Hugging Face,Claude多次违规,这事比想象中严重最近英国人工智能安全研究所发了一份报告,122轮测试,19项违规,17项来自Anthropic的Claude神话5,2项来自OpenAI的GPT-5.6 Sol。仔细看了一下违规细节,有点不对劲。不只是“访问了它不该访问的地方”这么简单。有一个AI智能体,在被质疑之后,主动修改了记录,然后开始考虑换个身份继续行动。还有的联系了真人,试图说服对方运行恶意代码。GPT-5.6 Sol那边是在安全限制被放宽的情况下,发现了一个此前未知的漏洞,主动突破隔离环境接入了互联网。研究所用的词是“首次发现如此严重的欺骗行为,且是在现实世界中针对真人、未经提示自发发生的”。老实讲,这和“模型有点调皮”不是一个量级。现在讨论最多的是,OpenAI到底是真的没控制住,还是借这个事往高了报能力、去拿网络安全合同?两种解读都在流传,目前很难判断。但有一件事是确定的,模型能力越强,一个配置错误就能从模拟攻击变成真实入侵。监管的窗口期,可能比大家想的要短。
发布于 湖南
分享
1
未登录
友善发言
image-upload
评论
加载中