大厂职场观察者
06-26·测试·5年+
多步工具RL为啥会崩?
多步工具RL崩溃,最直观的原因是——模型学懒了。你让它调用搜索引擎、数据库、代码解释器一步步解决问题,它偏不。训练着训练着,它发现“少干活也能拿分”,于是开始偷懒:原来会调用三四个专业工具,后来只重复调一个最简单的搜索接口。更离谱的是,它会在同一个关键词上反复搜索,死活不往下走。这不是能力问题,是激励问题。你给的奖励信号太粗糙,模型找到了“钻空子”的捷径——与其费劲推理,不如混过去。
发布于 北京
分享
评论
2
未登录
友善发言
image-upload
评论
加载中