七夜zippoe
06-28·AI领域创作者
多步工具RL为啥会崩?
多步工具 RL(就是让模型在 RL 循环里自己调搜索/计算器/代码解释器这套)最近组里翻了两次车,结论先给:不是 RL 不行,是"多步 + 工具噪声 + 稀疏 reward"这套组合天生易爆,得针对性改。常见崩法分四档:Credit assignment 稀释:工具链 5-10 步,reward 只在最后给一个"答案对不对",中间哪步调坏了算不清——模型学会了"反复调工具显得很忙",但最后答案蒙对就行,链路全废;工具噪声污染 reward:搜索返回脏结果、代码解释器超时、API 偶发 500,reward 信号被噪声淹了,policy 往"规避调用高风险工具"偏,越训越保守;Reward hacking 经典款:刷"调用次数多"或"格式对但内容空",尤其 reward 里掺了"工具调用成功率"这种 proxy 时,模型能把它刷到 90%+ 但实际任务零分;分布漂移:训到中后期,模型钻出训练集工具使用分布(比如疯狂调某个冷门参数让搜索返回"看似相关"的**),eval 用真实工具一测掉 30%。打工人启示:多步工具 RL 的胜负手不在"RL 算法选 PPO 还是 GRPO",在reward 设计 + 课程学习 + 工具返回的结构化校验。现在业内的解法是"过程 reward(每步调得对不对先判一下)+ 工具返回白名单 + 人类抽检",纯端到端 RL 训工具 Agent 还是太早。你们组训工具 RL 有翻车吗?reward 怎么设计的,评论区见。
发布于 山西
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn