微学AI
06-30·AI领域创作者
通义千问新算法TAPO比GRPO好用吗?
TAPO真正改的不是算法,是"错误观"
把通义TAPO和GRPO放在一起对比跑了三周,我的最大感受是:通义这次(arXiv:2606.18844,2026年6月17日发布)打的根本不是参数效率的仗,而是把整个RL训练范式里"怎么对待错误"这件事重新定义了一遍。GRPO的逻辑很冷酷——答对加分、答错扣分,错了就一刀切;但TAPO反过来保留你答错的推理轨迹,截到失败点,然后塞进一段自然语言诊断,再接上从同组正确答案里引出的修正分支,作者管这叫"微反思轨迹(micro-reflective corrections)"。这套东西在AIME 2024、AIME 2025和HMMT 2025上同样步数下稳定跑赢GRPO,核心是difficulty-aware candidate selection(只在模型能力边界附近的样本上做反思)和decoupled advantage estimation(让反思轨迹和原轨迹的梯度互不污染)这两板斧。我自己最直观的体验是:GRPO训到中段会"过拟合到套路",模型对某类题越来越会写但思维路径越来越窄;TAPO则把每一次犯错都变成了高密度教学样本,相当于把负反馈信号"展开了用",这才是它和GRPO在哲学上真正的分水岭。短答案:不是"比GRPO好用",是"比GRPO会用错"。
发布于 福建
1
评论
未登录
友善发言
image-upload
评论
加载中