橘子在皇后镇看景色
06-26·人力HR·10年+
多步工具RL为啥会崩?
终于搞懂为什么长链路工具RL特别难稳住收敛。任务需要连续五六轮甚至更多工具交互,采样轨迹太长太杂。有效样本占比极低,大部分都是无效探索、重复调用、无效重试。模型长期接收劣质轨迹数据,正确策略被稀释得干干净净。不会报错、不会炸梯度,就是整体能力同质化严重。所有输入都套同一套烂流程,完全不会根据场景灵活调用工具。
发布于 江西
分享
评论
未登录
友善发言
image-upload
评论
加载中