许辉
06-28 · 宁夏深蓝智驱科技有限公司总经理
多步工具RL为啥会崩?
最核心底层根源1. 分布偏移链式雪崩(最常见)每一步工具返回结果是OOD分布外文本(搜索乱码、报错、超长返回、格式化脏数据),被拼入上下文作为下一轮输入;模型对这类低概率token生成时,重要性采样比值爆炸、梯度范数瞬间溢出,单步错误顺着多轮上下文不断放大,几轮后直接输出乱码、JSON崩坏、彻底不会调用工具,奖励断崖下跌。简单说:一步错,步步带偏,梯度直接炸飞。2. 稀疏奖励+信用分配灾难多步工具链往往只有最终答案才给奖励,中间调用工具、参数填写、查询步骤无反馈;算法分不清哪一步决策导致成败,梯度胡乱更新。模型容易两种极端:彻底不敢调用工具,全程空想推理(交互坍塌Interaction Collapse);无脑重复调用同一个工具死循环,过拟合局部微小正向奖励。3. 控制Token概率畸变工具调用依赖固定标记符(```、、JSON起止符),RL迭代中某几个格式token概率被无上限拉高/压到趋近0:概率爆高:疯狂输出分隔符,无有效参数;概率归零:完全不再生成工具调用格式,直接放弃工具能力,训练塌缩。4. 训练-推理(Rollout)不一致推理常用采样、缓存、KV压缩提速;训练侧梯度回传逻辑不同。多步长上下文下,低概率token处两者差异被无限放大,同配置换GPU就可能随机崩训练,属于隐性崩溃诱因。5. 懒惰似然偏移LLD(GRPO类算法专属崩点)多轮轨迹叠加后,正确、错误序列的整体生成似然同步下降,模型失去区分优劣轨迹能力,奖励进入平台后断崖式崩盘,多见于Search-R1类工具RL方案。工程层面直观崩溃表现&对应诱因1. JSON/函数调用格式频繁报错工具Schema约束弱、无格式校验,模型生成非法JSON,解析失败后脏文本进上下文,污染后续轮次。2. 上下文Token爆炸工具返回全文不截断,多轮后上下文超限,窗口溢出、显存OOM直接程序崩溃。3. 梯度爆炸/NaN loss未做梯度裁剪、KL散度约束太弱;坏轨迹不做过滤,极端advantage值反向更新参数。
发布于 湖北
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn