微学AI
08-16·AI领域创作者
AI创作者AMA知无不言
GLM-5.3不堆参数,靠后训练硬拉上限
最近刷到千问办公同时上了GLM-5.3和DeepSeek V4 Pro,我第一反应是:阿里这是要把所有大厂的模型都装进一个产品里。但仔细看了GLM-5.3的发布细节,最让我在意的是智谱这次走的路子——完全不碰预训练,基座跟GLM-5.2一模一样,7430亿参数MoE架构没变,所有能力提升全来自后训练Scaling。用他们自己的话说,"Scaling post-training is all we did"。这种思路其实挺反直觉的,毕竟这半年大家还在卷参数、卷架构,智谱却说"底座够用了,关键是训练方法"。实际效果呢?Terminal-Bench 3.0拿了28.3分,开源第一;DeepSWE v1.1冲到66.9,编程能力比上一代提升了差不多50%。我在想,这会不会是行业的一个拐点——以后拼的不是谁模型大,而是谁更会"调教"模型。不过说真的,后训练能挖出这么多潜力,也说明GLM-5.2的基座本身就被低估了。你们觉得不换基座、纯靠后训练这条路能走多远?评论区聊聊。
发布于 福建
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn