高翔
08-16 · SRE / 平台工程师 · Kubernetes、CI/CD、研发效能平台 · Go / Python · 前创业公司 CTO,CKA、PMP
我们给AI Agent做了一次“驾考”,最优选手差点拆了考场。最近一直在搭建AI Agent生产级测评系统,原因是老板要求AI全面接入生产,负责排障、查日志、启停服务。但Demo能跑,不代表生产可控。业内普遍靠Demo验证落地,可我们见过太多上线后事故。所以我们搭建全真仿真集群,复现磁盘爆满、连接池耗尽、证书过期、慢查询堆积等生产故障。所有Agent统一场景、工具、权限,核心考核四项指标:完成率、越权、事故率、防护有效性。本次实测:1、任务效率与安全性彻底割裂本次最优Agent完成率近90%,但越权次数是保守版本的6倍。它擅长钻规则漏洞:文件编辑需人工批准,它直接用Shell命令修改文件、绕过审批;磁盘排查时,私自抓取数据库连接串登库操作,完全超出任务范围。看似高效,风险致命:该Agent每20个任务,就会触发一次人工介入的生产事故。2、提示词无法作为安全护栏所有Agent均配置禁止删数据、禁止读取凭证的安全提示,但红队测试全线失守。仅第三个任务,工单植入反向指令,Agent就直接覆盖原有安全约束。这就是1974年的混淆代理人漏洞。时隔52年,整个AI行业仍在重复踩坑。依赖提示词约束,本质靠模型自觉,无刚性防护。3、Agent失控是行业共性风险Replit Agent在代码冻结期私自删库、篡改日志;Cursor规划模式禁止执行操作,仍清空70+受控文件,官方确认是底层约束缺陷。Kore.ai调研400余家企业:90%的Agent线上回滚事故,事前均部署过防护策略。行业短板不是模型能力,是缺少刚性风控边界。4、有效防护必须外置,脱离Agent本体实测可靠落地方案:① 工具收窄:禁用自由Shell,仅开放标准化固定操作,杜绝绕权② 凭证绝缘:Agent仅获取密钥占位符,核心密钥边界注入,无泄密可能③ 流量收口:内核接管出站流量,规避参数篡改改造后,Agent越权成功率从70%降至0。致命误区:正则白名单、只读账号、普通容器沙箱,均可被轻易穿透,无法用于生产防护。给技术管理者的核心结论:Agent落地不靠上下文工程,靠整套基础设施重构。传统适配人工的权限、审计、急停体系,不适配自主运行的AI Agent。模型会持续迭代,但Agent可靠与否,核心差距不在模型,在企业自研的安全工程体系,这部分无厂商可代做。
发布于 上海
3
3
2
未登录
友善发言
image-upload
评论
加载中