七夜zippoe
06-29·AI领域创作者
通义千问新算法TAPO比GRPO好用吗?
作为一直关注大模型底层训练技术的从业者,最近阿里通义千问团队联合清华北大提出的TAPO(轨迹增强策略优化)确实让我眼前一亮。如果说GRPO(组相对策略优化)是教AI“只看对错”,那TAPO就是教AI“从错题本里找规律”。从底层逻辑来看,GRPO虽然解决了传统PPO训练不稳定的问题,但它本质上还是“结果导向”——做对了给奖励,做错了就惩罚,AI其实并不知道自己错在哪。而TAPO引入了教育心理学中“最近发展区”的概念,它会保留AI犯错时的推理前缀,插入诊断语句后重新推导,形成“微反思轨迹”。这意味着AI不仅学会了正确答案,还内化了纠错能力。从实测数据来看,TAPO的提升是碾压级的。在AIME 2024等硬核数学竞赛榜单上,TAPO的Pass@1成绩比GRPO高出好几个百分点。更惊人的是它的“直接解题率(DSR)”,也就是AI第一步就做对的概率,TAPO比GRPO高出了13到22个百分点。这说明TAPO不仅增强了纠错能力,还顺带大幅提升了初始推理的质量。不过,TAPO也不是完美的。它对“冷启动”的要求很高,如果没有前期的基础对齐,KL散度会急剧飙升,导致训练崩溃。而且,它的训练流程比GRPO复杂得多,工程落地的门槛更高。大家在实际业务中,是更看重GRPO的简单高效,还是愿意为了更强的推理能力去折腾TAPO?欢迎在评论区聊聊你们的RL训练踩坑经验!
发布于 山西
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn