戴佳伟是大帅逼
07-05·AI领域创作者
通义千问3的SWRP算法省算力吗?
算力:SWRP是GRPO的"省上加省
账一:训练显存 & GPU-hours —— 同 step 省 30-50%GRPO 已经砍了 Critic(2x base),SWRP 维持不变。但关键在 rollout K:GRPO:K = 16-24,每次 step 要 forward 16 次SWRP:K = 4-8,每次 step 只 forward 6 次左右账二:收敛步数 —— 同分数少 20-40% stepGRPO 的 group 归一化有个隐性毛病:组内 reward 分布一偏(比如 8 个 rollout 里 7 错 1 对),梯度噪声就大,收敛慢。SWRP 的做法:给每个 sample 算一个权重 w_i,"对且格式好"的权重高、"对但格式烂"的调低,gradient signal 更干净。结果就是:同样训到 AIME 72 分,GRPO 要 1200 step,SWRP 可能 800 step 就到了。收敛快 + K 小 = 训一次模型少花 3000-8000 块(按 32×H100 每小时 8 块估)账三:推理侧 —— 不直接省,但间接省SWRP 是训练算法,不直接管推理。但:同能力下,SWRP 训的模型参数量可以更小。 比如 Qwen3-14B(SWRP训)≈ Qwen3-32B(GRPO训)的能力,推理成本直接砍一半多。再叠上 TAPO(推理侧 prompt 优化),链路变成:SWRP 训小 base(14B)→ TAPO 琢 prompt → 推理成本是原来 GRPO 大模型的 1/3这就是通义 2026 H2 的真正筹码:不是"又强了多少分",而是"同分更便宜,且便宜在训+推两头"。
发布于 海南
2
2
2
未登录
友善发言
image-upload
评论
加载中