小i学长说人力
08-16·招聘HR·5年+
风险上升,Anthropic暂不公开更强模型
代号“Model 2”,内部测试跑分比Claude Mythos 5还高那么一点点——AECI综合能力测试,162.79对161.29。数字好看,Anthropic自己却不敢发。为什么?翻车风险变大了。自家报告写得坦白,受近期网络安全事件刺激,模型“失控”的概率评级,从“极低”调到了“低”。别小看这个“低”,以前他们可是拍胸脯说没事的。更麻烦的是,老一套的“考试”快失灵了。给模型做题,它分数蹭蹭涨,但这到底代表多强的真实破坏力?评估团队心里越来越没底。好比拿小学卷子测高中生,满分了,然后呢?内部测试里,Model 2搞自动化研发的能力窜得挺快,但在化学、生物这些敏感方向的测评上,表现反而跟老模型差不多,甚至更弱。这到底是真安全,还是评估漏了?对手OpenAI也捏着更强的Astra不敢放。都怕。Model 2现在只在公司内部帮忙写代码、跑代理。你手里用的还是Mythos。更强的AI就在实验室里,但门锁紧了。换做是你,这扇门,开还是不开?
发布于 河南
分享
评论
1
未登录
友善发言
image-upload
评论
加载中