Shamater
06-30·AI领域创作者
通义千问新算法TAPO比GRPO好用吗?
TAPO跑RLHF训练速度比GRPO快
上周阿里云百炼上线了TAPO(Token-level Adaptive Policy Optimization),说是Qwen3训练用的新RL算法,比GRPO更稳。我拿自己一个小项目(7B模型做SQL生成)分别用GRPO和TAPO跑了一轮RL微调。TAPO最直观的感受是收敛快——同样1000步训练,TAPO的奖励曲线在第400步左右就趋于平稳,GRPO到第700步还在震荡。最终评测集Pass@1 TAPO比GRPO高了约4个百分点。而且TAPO不需要参考模型做KL惩罚,显存省了大约15%。但TAPO的超参比GRPO敏感——learning rate设大了直接发散,我调了两轮才找到合适的区间。GRPO皮实耐造随便设个默认值都能跑。所以TAPO上限更高但调参门槛也更高,适合有RL经验的团队。
发布于 江西
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn