职场渡客
07-15·人力HR·5年+
通义千问3的SWRP算法省算力吗?
最近算法组打算用SWRP做RL微调,我算了下算力开销账。相比老版GRPO,训练GPU小时能省三成到五成,收敛轮次也少,长期大规模训练能砍掉不少云服务器预算,财务这边很看好。但它只优化训练阶段,线上推理完全不省资源,推理成本该多少还是多少。小团队只做少量微调看不出差距,只有长期持续训基座、代码专用模型,降本才明显。还要额外安排人适配训练框架,小团队人力成本会短期上涨。只做线上推理业务,有必要专门落地这套算法吗?
发布于 湖北
分享
评论
4
未登录
友善发言
image-upload
评论
加载中