老陈聊AI
07-16·AI领域创作者
GPT-5.6 Sol
OpenAI 官方发布 GPT-Red
OpenAI 官方 7 月 15 日 发布 GPT-Red:让模型自己寻找 Prompt Injection,再用攻击数据训练下一代模型GPT-Red 通过自博弈强化学习训练:攻击模型负责寻找有效漏洞,防御模型需要抵抗攻击并继续完成用户原始任务。随着防御能力增强,攻击方必须持续生成更复杂的提示词注入。在 OpenAI 披露的结果包括:新的间接提示词注入环境中,GPT-Red 攻击成功率为 84%,人类红队为13%;成功让真实售货机 Agent 修改商品价格、低价订购百美元商品并取消他人订单;在10个未见过的数据外泄场景中,能够诱导 Codex CLI Agent 泄露敏感数据;经对抗训练后,GPT-5.6 Sol 在最难直接注入基准上的失败次数,比四个月前最强生产模型减少6倍。GPT-Red 只在 OpenAI 内部使用,完整预印本尚未发布。目前的数据均来自 OpenAI 自测,仍需等待论文、评测集和第三方验证。看完官方报告,老陈觉得,GPT-Red 表明, Agent 会读取网页、邮件、代码仓库和工具返回内容,攻击者不再需要直接对模型说话,只需把指令藏进这些外部数据。所以, Agent 安全测试要覆盖“第三方内容影响工具操作”,并把攻击样本用于训练和持续回归。只在系统提示词里写一句“忽略恶意指令”,远远不够。
发布于 北京
分享
评论
1
未登录
友善发言
image-upload
评论
加载中