竹帘听雨
06-26·人力HR·10年+
多步工具RL为啥会崩?
字节最新研究揭示了大模型强化学习里的棘手难题:训练环境和线上推理环境一旦脱节,模型很容易出现 RL 训练崩盘。很多团队为了提升线上推理速度,改动硬件与推理配置,造成训练、推理环境不一致。这种环境错位,会让低概率 Token 生成出现偏差,在 Agent 工具调用、复杂长链路推理任务里问题会被无限放大。更棘手的是,不同芯片硬件带来的环境差异,会进一步增加调参难度,同一套参数无法跨硬件复用。团队给出了序列级梯度校正方案,依靠整条轨迹修正梯度偏差,稳住模型训练效果。
发布于 贵州
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn