我不焦绿
07-15·后端开发·5年+
通义千问3的SWRP算法省算力吗?
负责通义千问3微调服务开发,摸透SWRP的算力优化边界。核心省算力逻辑是缩减rollout采样数,不用额外加载Critic网络,大规模强化学习训练性价比很高,同等硬件能多跑两三倍实验。落地局限很清晰,推理侧没有优化,线上接口并发高该扩容还是扩容;老旧训练框架适配要改调度脚本,小集群算力提升幅度有限。如果业务长期要迭代基座、代码Agent模型很合适,只是调用现成模型做线上服务,花精力部署SWRP是不是得不偿失?
发布于 湖北
分享
评论
3
未登录
友善发言
image-upload
评论
加载中