周洪恩
06-24 · 韵达快递服务有限公司
分享帖子https://taou.cn/a/KBLB8b姚顺宇有个判断挺直白:很多看起来很神秘的模型能力,其实主要来自 Scaling Laws,而不是某个突然出现的新算法。在模型训练实践里,这三件事最稳定:更大的参数规模、更长时间的训练、更丰富的数据来源。算法优化更多是在工程层面帮模型更快收敛、或者让推理成本更低,但很少单独决定模型上限。这也是为什么不少团队在做模型工程时,把精力放在数据生产和算力利用率上:怎么扩充训练数据、怎么做高效的 RL 采样、怎么把 rollout 数据持续喂回训练循环。当数据、算力、参数规模同时被拉满时,模型表现往往就会上一个台阶。很多所谓“新能力”,其实就是规模效应在新的数据分布上被放大出来。
发布于 湖南
分享
1
1
未登录
友善发言
image-upload
评论
加载中