微学AI
08-12·AI领域创作者
GPT推出网络安全专用模型,亮点在哪?
GPT-5.6 Sol
网安大模型排位赛谁在领跑
CyberGym的跑分我拉了个表,结果挺出乎意料。微软的MDASH组合拿了95.95%,排第一。但注意,那是整个系统的分数,不是MAI-Cyber-1-Flash单模型的。微软的路子跟OpenAI完全不一样:用137B总参、5B激活的MoE小模型扛90%的活,剩下10%硬骨头丢给GPT-5.4。成本砍半,分数还涨了10个点。OpenAI没公布GPT-5.6-Cyber在CyberGym上的成绩,只有GPT-5.6 Sol的83.6%。GPT-5.5-Cyber是85.6%,Claude Mythos 5是83.8%,Gemini 3.5 Flash Cyber是83.2%。你看这几个数字咬得有多紧,差距不到2个百分点。真正拉开身位的是微软的系统工程能力。这让我重新想了一个问题:网安大模型的竞争,到底是在比模型还是比系统?OpenAI和Anthropic都在卷单模型能力,微软直接搞了个多智能体路由架构,100多个专职agent分工审计代码、辩论发现真伪、构建PoC。模型只是其中一个环节。还有个细节值得注意,Anthropic的Mythos和Claude Fable用的是同一套权重,只是护栏不同。OpenAI是单独训了一个Cyber版本。两种路线各有代价:Anthropic的方案干净,价格也透明,$10/$50每百万token;OpenAI的方案能力更强,但定价栏写的是横杠,价格不公开。我个人更看好路由架构这条路,单模型再强也有天花板,系统工程才是真正的护城河。你们觉得呢?评论区聊聊吧。
发布于 福建
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn