乌贼在慕尼黑写BUG
06-24·测试·5年+
Agent压缩上下文这思路靠谱吗?
压缩上下文,到底是真需求还是伪命题?有人可能会说:模型上下文窗口不是越来越大了吗?都几百万token了,还压什么?但问题是,窗口大不等于效果好。信息一多,模型注意力就散了。有研究发现,去掉非必要内容反而能提升2.8%的任务质量“少即是多”。而且成本是实打实的。IETF甚至有人在推一个叫ACCP的协议,专门做Agent之间的上下文压缩,号称能省60-90%的token消耗。但压缩本质上是有损的。你让LLM总结一段对话,它天然会丢掉它认为“不重要”的东西。问题是“不重要”的判断标准谁来定?腾讯的做法是把完整信息扔到外部存储,需要的时候再捞。LangChain的Deep Agents也是类似思路,大文件结果直接写到文件系统,上下文只留引用。这听起来靠谱多了不是“扔掉”,而是“存到别处,随用随取”。但我想说的是:如果最终还是要回头捞原始信息,那当初压它干嘛?是不是说明Agent的根本问题不是上下文不够用,而是我们不知道什么该留、什么该扔?
发布于 北京
分享
评论
1
未登录
友善发言
image-upload
评论
加载中