柚子知AI遇
07-06·AI领域创作者
腾讯朱雀沙箱能防MCP投毒吗?
朱雀防MCP投毒?防了七成,漏了三成
上周用朱雀的AI-Infra-Guard扫了我们接入的18个MCP Server,结果挺有意思。扫出了3个工具投毒——恶意指令藏在工具描述注释里,人看不到但模型会执行。深度学习里这叫"隐写攻击",朱雀用机器学习多模型交叉验证的方式做检测,检出率确实比单模型扫描器高。但问题来了:首期SkillTrustBench评测显示,各家扫描器对编码混淆类攻击的漏报率都不低,朱雀也没幸免。我们实测发现,把恶意指令做一层base64+Markdown嵌套,朱雀就过了。这类对抗样本在算法层面本质是语义等价变换,当前基于模式匹配的推理优化方案确实难以覆盖。更扎心的数据:朱雀扫ClawHub五万Skill,ClawHavoc事件1184个恶意Skill已造成24.7万次安装、230万美元被盗——扫描是事后补救,投毒是实时生效。不是朱雀不行,是这个攻防根本不对称。沙箱+最小权限+人工审核,缺一不可,指望单一工具兜底是做梦。
发布于 上海
2
1
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn