王西蒙AI创客
06-29·科大讯飞员工
通义千问新算法TAPO比GRPO好用吗?
GRPO现在是大模型后训练阶段的工业标准。但TAPO的研究团队指出GRPO有两个根本缺陷。一是"隐式且不可控的监督"——AI只是机械地模仿正确版本的"数字画像",从未真正理解自己的错误在哪里。二是在错误点上施加过大的惩罚信号,会让AI的"思维多样性"逐渐下降,越来越保守。TAPO的做法更有教育学的味道。它借鉴了维果茨基的"最近发展区"理论——真正有效的教学必须从学习者当前的理解水平出发,包括他们的错误。TAPO从错误答案里挑一个,再从正确答案里随机挑一个作参考,让AI自己分析错误,找出第一个关键错误点,保留之前的正确推理,插入一段诊断,然后重新推理。这在AIME 2024、AIME 2025和HMMT 2025这些顶级数学竞赛题上,TAPO在相同训练步数下都优于GRPO。
发布于 四川
分享
评论
未登录
友善发言
image-upload
评论
加载中