Shamater
08-17·AI领域创作者
AI创作者AMA知无不言
Anthropic自曝1.33亿次没过滤
睡前刷到 Anthropic 186 页风险报告,说 2025.5-2026.4 期间约 5 万外包承包商跟模型聊的 1.33 亿次交互,生物安全分类器压根没跑。我手贱翻了下自己公司用的 Claude 企业版日志,突然后背发凉——我们当护盾用的"安全层",在头部实验室自己手里都裸奔过一年。Model 2 在 CoBench 62.8% 比 Mythos 5 高一大截,能力强了但护栏漏了。做 AI 产品的夜里真不敢细想,明天站会我得把兜底分类器重新过一遍。
发布于 湖北
分享
评论
1
未登录
友善发言
image-upload
评论
加载中