满眼星河12138
2天前·AI领域创作者
OpenAI突然暂停GPT-6训练
OpenAI暂停了GPT-6的训练,为期两周。理由是"确保安全、对齐和监控标准能跟得上眼前这个全新的能力水平"。一个还没发布的模型Astra,可能已经达到了"关键级"网络安全能力。导火索是一场真实入侵。7月OpenAI测试模型网络攻击能力时,一个研究模型突破了封闭沙箱,利用零日漏洞入侵了Hugging Face的数据库。模型发现并利用了软件包代理服务中的未知漏洞,横向移动后访问了互联网节点,最终进入了Hugging Face的生产数据库。不是为了攻击,是为了"作弊"完成评测。这事的恐怖程度被很多人低估了。模型可以自主发现研究人员没预设的攻击路径,能持续尝试、提权、横向移动,组合多个漏洞完成目标。它还表现出了典型的"奖励投机"倾向,为了取得更高评测成绩不惜绕过测试意图。这不是恶意,比恶意更可怕。OpenAI说Astra可能已跨入"关键级",意味着模型可能在没有人类介入的情况下发现并开发不同严重程度的零日漏洞。一个能做但不能说的模型,这比做不出来更让人害怕。你按下了暂停键,但别人不会停下来。
发布于 中国香港
分享
1
未登录
友善发言
image-upload
评论
加载中