屿上观风
2天前·后端开发·10年+
国产编程模型谁最强?
三个模型各赢在哪
说GLM-5.3综合最强,不是拍脑袋,把同一批任务逐项拆开,胜负就很清楚了。标准编码这类日常活,三个模型差距不大,都能用,速度上DeepSeek V4 Pro略快,毕竟部署成熟、大家用得久。到了长程任务差距就拉开了:跨八、九个文件的整体重构,GLM-5.3的DeepSWE v1.1拿了66.9,基本是Fable 5的水平,DeepSeek 62.7紧随,Qwen3.8直接掉到56.6,改着改着就把上下文丢了,这是它最大的短板。终端agent实操(Terminal Bench 2.1)GLM-5.3也是88.2第一。但纯推理题Qwen3.8反杀,GPQA Diamond 92.6%全场最高,GLM和DeepSeek都够不着。所以拆开看结论很清楚:GLM-5.3赢在编程主战场,Qwen3.8赢在推理副科,DeepSeek赢在均衡和成熟度。如果你要的是"写代码最强",那GLM-5.3没悬念。但这里有个前提我要说清楚——横评用的是基准任务,你的项目如果全是推理类问题,选Qwen3.8反而更合适。综合最强,不等于对你最强。
发布于 广东
分享
1
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn