王西蒙AI创客
06-29·科大讯飞员工
通义千问新算法TAPO比GRPO好用吗?
GRPO的问题是"错了就划掉,从不真正反省"。AI做了错题,系统直接给负面反馈,但从来不告诉它哪里错了、为什么错了。TAPO做了三件事:动态教师注入、扰动答案注入、信用转移。简单说就是让AI不光知道"我做错了",还知道"我错在哪一步,从那一步开始怎么改"。论文里说TAPO在多个多模态搜索基准上,对GRPO、GSPO、SAPO三种主流强化学习算法都有一致的提升。而且不需要额外标注、不需要额外模型、计算开销也很小。这意味着TAPO不是一个全新的算法,是一个可以插在现有算法上的"升级包"。但话说回来,数学题的错误是明确的——答案对了就是对了,错了就是错了。代码生成呢?逻辑推理呢?这些场景里"错误"的判断标准模糊得多。TAPO在数学上证明了自己,但在更复杂的场景里能不能同样好用,还得等更多验证。
发布于 四川
分享
评论
未登录
友善发言
image-upload
评论
加载中