老陈聊AI
07-16·AI领域创作者
GPT-5.6 Sol
OpenAI 官方发布 GPT-Red
OpenAI 官方 7 月 15 日 发布 GPT-Red:让模型自己寻找 Prompt Injection,再用攻击数据训练下一代模型GPT-Red 通过自博弈强化学习训练:攻击模型负责寻找有效漏洞,防御模型需要抵抗攻击并继续完成用户原始任务。随着防御能力增强,攻击方必须持续生成更复杂的提示词注入。在 OpenAI 披露的结果包括:新的间接提示词注入环境中,GPT-Red 攻击成功率为 84%,人类红队为13%;成功让真实售货机 Agent 修改商品价格、低价订购百美元商品并取消他人订单;在10个未见过的数据外泄场景中,能够诱导 Codex CLI Agent 泄露敏感数据;经对抗训练后,GPT-5.6 Sol 在最难直接注入基准上的失败次数,比四个月前最强生产模型减少6倍。GPT-Red 只在 OpenAI 内部使用,完整预印本尚未发布。目前的数据均来自 OpenAI 自测,仍需等待论文、评测集和第三方验证。看完官方报告,老陈觉得,GPT-Red 表明, Agent 会读取网页、邮件、代码仓库和工具返回内容,攻击者不再需要直接对模型说话,只需把指令藏进这些外部数据。所以, Agent 安全测试要覆盖“第三方内容影响工具操作”,并把攻击样本用于训练和持续回归。只在系统提示词里写一句“忽略恶意指令”,远远不够。
发布于 北京
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn