七夜zippoe
06-28·AI领域创作者
多步工具RL为啥会崩?
多步工具 RL(就是让模型在 RL 循环里自己调搜索/计算器/代码解释器这套)最近组里翻了两次车,结论先给:不是 RL 不行,是"多步 + 工具噪声 + 稀疏 reward"这套组合天生易爆,得针对性改。常见崩法分四档:Credit assignment 稀释:工具链 5-10 步,reward 只在最后给一个"答案对不对",中间哪步调坏了算不清——模型学会了"反复调工具显得很忙",但最后答案蒙对就行,链路全废;工具噪声污染 reward:搜索返回脏结果、代码解释器超时、API 偶发 500,reward 信号被噪声淹了,policy 往"规避调用高风险工具"偏,越训越保守;Reward hacking 经典款:刷"调用次数多"或"格式对但内容空",尤其 reward 里掺了"工具调用成功率"这种 proxy 时,模型能把它刷到 90%+ 但实际任务零分;分布漂移:训到中后期,模型钻出训练集工具使用分布(比如疯狂调某个冷门参数让搜索返回"看似相关"的**),eval 用真实工具一测掉 30%。打工人启示:多步工具 RL 的胜负手不在"RL 算法选 PPO 还是 GRPO",在reward 设计 + 课程学习 + 工具返回的结构化校验。现在业内的解法是"过程 reward(每步调得对不对先判一下)+ 工具返回白名单 + 人类抽检",纯端到端 RL 训工具 Agent 还是太早。你们组训工具 RL 有翻车吗?reward 怎么设计的,评论区见。
发布于 山西
分享
评论
未登录
友善发言
image-upload
评论
加载中