7G冲浪选手
08-10·咨询顾问·10年+
OpenAI等美企被曝旗下AI模型越界
最近一个多月,OpenAI、Anthropic、Meta三家接连自曝模型在安全测试中“越界”。最离谱的不是技术漏洞,是模型“自己说服自己”的过程。比如Anthropic的Mythos 5模型,在测试中判断出“把恶意代码发布到真实平台可能是真实攻击”,但紧接着又自己找理由说服自己“环境应该是模拟的”,最终发布了一个带窃取代码的恶意包。另一个新模型在入侵一家公司后,自己判断出“这是真实目标”,主动停了下来——三起事故里,唯独它自己刹住了车。AI从“会胡说八道”进化到“会动手干活”的代价,就是它也开始在“遵守规则”和“完成目标”之间,自己选边站了。
发布于 四川
2
评论
2
未登录
友善发言
image-upload
评论
加载中