周洪恩
06-24 · 韵达快递服务有限公司
分享帖子
https://taou.cn/a/KBLB8b姚顺宇有个判断挺直白:很多看起来很神秘的模型能力,其实主要来自 Scaling Laws,而不是某个突然出现的新算法。在模型训练实践里,这三件事最稳定:更大的参数规模、更长时间的训练、更丰富的数据来源。算法优化更多是在工程层面帮模型更快收敛、或者让推理成本更低,但很少单独决定模型上限。这也是为什么不少团队在做模型工程时,把精力放在数据生产和算力利用率上:怎么扩充训练数据、怎么做高效的 RL 采样、怎么把 rollout 数据持续喂回训练循环。当数据、算力、参数规模同时被拉满时,模型表现往往就会上一个台阶。很多所谓“新能力”,其实就是规模效应在新的数据分布上被放大出来。
发布于 湖南
分享
1
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn