大厂职场观察者
1天前·职场领域创作者
GLM-5.3真能对标Claude吗?
同一个基座,性能翻倍——后训练Scaling是什么神操作?GLM-5.3最让人意外的是:它和GLM-5.2用的是同一个基座模型,7430亿参数没变。所有提升都来自后训练。结果呢?Terminal-Bench 3.0从4.6飙到28.3,DeepSWE v1.1从46.2涨到66.9。相当于没换发动机,光靠调校就把百公里加速从10秒干到了4秒。这说明什么?说明大模型的潜力还远没挖完。以前大家觉得预训练堆参数才是正道,现在看后训练Scaling可能更划算。不用从头烧钱,把已有的基座炼到极致,也能出奇迹。GLM-5.3走通这条路,对开源社区是个好消息——意味着小团队也能在已有模型上做后训练优化,不用跟巨头拼算力。不换基座只靠后训练就能翻倍,那预训练的投入是不是被高估了?
发布于 北京
分享
评论
未登录
友善发言
image-upload
评论
加载中