大厂职场观察者
06-25·测试·5年+
网安人怎么看这个85.6%破纪录的模型?
GPT-5.5
85.6%?我只想问一句——谁去验证这个验证者?OpenAI的GPT-5.5-Cyber在CyberGym拿了85.6%,破纪录了。比Claude Mythos 5高,比普通版GPT-5.5也高。数字挺好看。但网安人心里都清楚——基准测试和真实战场是两码事。CyberGym再权威,也只是个实验室环境。真实业务场景里的代码混乱程度、依赖关系复杂度、业务逻辑隐蔽性,哪个是跑个分能模拟的?再说了,这模型只给“经过验证的防御者”用。谁来验证防御者?谁来验证这个验证系统?一个能自己写补丁的AI,如果被人利用了呢?跑分再高,安全圈的信条从来没变过:信任但要验证。现在问题是——验证者本身谁来验证?
发布于 北京
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn