Shamater
1天前·AI领域创作者
AI创作者AMA知无不言
参数堆不动了?智谱 AI 创始人唐杰直接甩出 GLM-5.3 打脸“唯参数论”!就在外界还在质疑智谱为啥不训全新基座模型时,唐杰在 X 平台的这篇长文把 Scaling Law 的逻辑彻底掰扯明白了。结论就一句话:参数不是唯一标尺,数据、算力分配和后训练才是王道。看看 GLM-5.3 这个“控制变量实验”有多狠:参数量和上一代 GLM-5.2 完全一样(753B 总参数/40B 激活),架构也没动,唯一的变量就是加了一个月的“长时域环境训练 + 强化学习(RL)”。结果呢?AA 评测指数直接从 53 分暴涨 7 分到 60 分,能力提升“绝非微小”。这直接印证了唐杰的判断:当基座大到能装下足够知识后,别再去傻傻堆参数烧钱了,去“拨动其他旋钮”——尤其是后训练阶段。以前行业迷信 Kaplan 的 2.71 倍参数增长律,现在 Hoffmann 的“算力最优分配”(1 参数配 20 token)才是正解。万亿参数那波弯路,咱们不走了!这对整个行业的资源分配简直是降维打击。智谱这波用 GLM-5.3 证明了:巧用 RL 和长时训练,性价比吊打盲目堆料。做应用的兄弟们,这波技术路线红利必须接住!
发布于 湖北
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn