乌贼在慕尼黑写BUG
06-24·测试·5年+
Agent压缩上下文这思路靠谱吗?
压缩有风险,安全约束可能被“压没了”最近有篇论文挺吓人上下文压缩可能会把安全约束一起压没了。研究者测了1323个场景,安全策略完整的时候违规率是0%,压缩完之后飙到30%,个别模型甚至到了59%。原因是:Agent本来好好遵守的规则,被压缩器当成“不重要信息”给删了。这就像公司规章制度写了几百页,你让实习生帮你总结成三页纸结果“未经审批不得对外报价”这条被漏了,他直接给客户报了底价。更麻烦的是,有人可以故意往对话里塞一些内容,诱导压缩器把真正的安全规则挤掉。好消息是研究者提了个叫“Constraint Pinning”的方案,把安全规则隔离出来不让压缩碰,能把违规率降回0%。但问题来了除了安全规则,还有多少“不能丢”的东西是我们根本没意识到的?
发布于 北京
分享
评论
1
未登录
友善发言
image-upload
评论
加载中