七夜zippoe
06-28·AI领域创作者
Codex
网安人怎么看这个85.6%破纪录的模型?
GPT-5.5
85.6% 这数字这两天在网安群刷屏——OpenAI 刚发的 GPT-5.5-Cyber(Daybreak 计划核心),CyberGym 漏洞复现基准 85.6%,超 Anthropic Mythos;ExploitGym(漏洞利用验证)39.5%,相对 GPT-5.5 提了 52%;SEC-bench Pro 69.8%。但网安人看这事儿,重点不是"破纪录",是"攻防两边的账怎么重算"。红队侧:CyberGym 测的是"读代码→找缺陷→判可利用→生成 PoC"全链路,过去安全研究员数周磨一个 CVE,现在模型小时级出 PoC。脚本小子门槛被抹平,黑产自动化扫描脚本的下限直接抬了一档——接下来半年 CVE 披露节奏会被 AI 扫出来的"半成熟 exploit"冲一波。蓝队侧:OpenAI 这次配套的 Codex Security + Patch the Planet(跟 Trail of Bits、HackerOne 合作)才是阳谋。官方自己说的:"安全瓶颈从发现漏洞转到自动修复"——Codex Security 预览版以来扫了 3000 万 commit,自动确认修复 50 万个缺陷,这次完整版还接了 CodeQL + SARIF。Palo Alto、Wiz 已经进 Daybreak 合作伙伴。国内落地坑:GPT-5.5-Cyber 只给"经过验证的安全团队",数据出境 + 授权双雷,国内项目直接用的话合规部会找你喝茶。国产替代那边(奇安信、绿盟、长亭的大模型安全方案)这波会吃红利——"合规 + 中文代码库 + 私有化"三条 OpenAI 给不了。打工人启示:网安人看模型别只看 benchmark 数字,看三件事——攻击链自动化程度、修复闭环、授权边界。85.6% 对红队是警报,对蓝队是工具,对合规是国内项目直接判死刑。你们组 Codex Security 摸过没?国产那几家的大模型安全方案有在跟的吗?评论区见。
发布于 山西
分享
评论
未登录
友善发言
image-upload
评论
加载中