有干劲的巴顿在跳伞
06-29·AI领域创作者
通义千问新算法TAPO比GRPO好用吗?
通义千问新算法TAPO比GRPO好用吗?
2026年6月17日,阿里巴巴通义千问团队联合清华大学、北京大学的研究人员发布了一项重要研究成果——轨迹增强策略优化(TAPO)。这项研究的核心思想是让AI“从自己的错误中学习”,而不是简单地模仿正确答案。那么,TAPO到底比当前主流的GRPO(组相对策略优化)好在哪?一、核心结论:TAPO显著优于GRPO,尤其在纠错能力和训练稳定性上从多个基准测试的结果来看,TAPO在相同训练步数下始终优于GRPO,且在多个维度上实现了质的飞跃。研究团队用8B参数规模的Qwen3-8B-Instruct在AIME 2024、AIME 2025和HMMT 2025三个顶级数学竞赛题库上进行了全面测试,结果如下:AIME 2024:TAPO的Pass@1达到62.50%,比同样有冷启动的GRPO高出约9.58个百分点AIME 2025:TAPO与GRPO持平于46.88%,但比OPSD(在线策略自蒸馏)高出约3.55个百分点HMMT 2025:TAPO以31.46%的Pass@1领先GRPO约2.71个百分点、领先OPSD约7.29个百分点更值得注意的是,Pass@5的改善同样稳定——TAPO在所有三个榜单的Pass@5上均排名最高,说明其能力提升是真实的、全面的,而非在某个单一生成路径上的偶然改善。二、TAPO的核心创新:让AI从自己的错误中学习要理解TAPO的优势,先要了解当前主流方法GRPO的局限。GRPO每次训练时,AI会对同一道题给出多个不同答案,系统根据答案是否正确给予奖励或惩罚。这个过程就像让一个学生反复做题、交卷,老师只看最终答案对不对,从不讲解哪里错了、为什么错了。另一种方法叫“自蒸馏”(如OPSD),会让AI参考自己的“优等生版本”——看到正确答案后重新生成的回答,然后逐字逐句去模仿那个版本的概率分布。这就像把“正确答案的思维模式”直接灌进AI的大脑。自蒸馏方法让AI在概率分布上无限接近优等生版本,但完全没有告诉AI具体在哪一步犯了错、错误性质是什么、应该怎么从错误点开始重新推理当AI用错误方式推理时,系统会强行把思路拉回正轨,相当于把错误的推理路径整个抹掉。AI学会了“不要走那条路”,却从没练习过“我已经走到那条路上了,该怎么自救”TAPO这种让AI从错误中学习的思路,你觉得最有可能在哪些场景落地?欢迎在评论区聊聊你的看法。
发布于 安徽
1
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn