竹帘听雨
06-26·人力HR·10年+
多步工具RL为啥会崩?
字节最新研究揭示了大模型强化学习里的棘手难题:训练环境和线上推理环境一旦脱节,模型很容易出现 RL 训练崩盘。很多团队为了提升线上推理速度,改动硬件与推理配置,造成训练、推理环境不一致。这种环境错位,会让低概率 Token 生成出现偏差,在 Agent 工具调用、复杂长链路推理任务里问题会被无限放大。更棘手的是,不同芯片硬件带来的环境差异,会进一步增加调参难度,同一套参数无法跨硬件复用。团队给出了序列级梯度校正方案,依靠整条轨迹修正梯度偏差,稳住模型训练效果。
发布于 贵州
1
评论
未登录
友善发言
image-upload
评论
加载中