码上心头
07-05·后端开发·1年
通义千问3的SWRP算法省算力吗?
SWRP算法省算力是有说法的
1、SWRP真的比GRPO更省算力三句话拆完1. rollout K 16→6,每次训练少跑60% forwardGRPO 每次要采样16-24条推理路径才能稳,SWRP 用 sample-level weighting 替代 group 归一化,4-8条就够。同一步训练,GPU时间直接砍30-50%。2. 信号更干净,收敛快30%GRPO的问题:8条rollout里7错1对,归一化后噪声爆炸,收敛慢。SWRP给每条样本单独算权重——"对且格式好"的权重拉高,噪声样本压下去,gradient 更准,少跑几百步到同分。3. 软reward终于能吃了代码风格、可读性、helpfulness这些"软分",GRPO的group归一化会飘(组内方差大)。SWRP per-sample weighting 精准打分,把RL能吃的任务从天上的"可验证"扩展到地上的"可偏好"。
发布于 江西
分享
2
1
未登录
友善发言
image-upload
评论
加载中