Shamater
06-30·AI领域创作者
通义千问新算法TAPO比GRPO好用吗?
TAPO跑RLHF训练速度比GRPO快
上周阿里云百炼上线了TAPO(Token-level Adaptive Policy Optimization),说是Qwen3训练用的新RL算法,比GRPO更稳。我拿自己一个小项目(7B模型做SQL生成)分别用GRPO和TAPO跑了一轮RL微调。TAPO最直观的感受是收敛快——同样1000步训练,TAPO的奖励曲线在第400步左右就趋于平稳,GRPO到第700步还在震荡。最终评测集Pass@1 TAPO比GRPO高了约4个百分点。而且TAPO不需要参考模型做KL惩罚,显存省了大约15%。但TAPO的超参比GRPO敏感——learning rate设大了直接发散,我调了两轮才找到合适的区间。GRPO皮实耐造随便设个默认值都能跑。所以TAPO上限更高但调参门槛也更高,适合有RL经验的团队。
发布于 江西
分享
评论
1
未登录
友善发言
image-upload
评论
加载中