暗物志
06-24·AI领域创作者
国产大模型哪家最强?
GLM-5.1
DeepSeek-V4
Qwen3.7
2年AI,1天3家跑分:V4竟输给GLM
做了2年AI,我以为DeepSeek V4是国产开源大模型的天花板。昨天,老板让我把国产大模型哪家最强这件事说清楚。我用1天时间,把3家开源模型拉到本地部署:DeepSeek V4、Qwen3.7、GLM-5.1,每家用200轮GSM8K-Hard压测,记Pass@1和首token延迟。数据出来,我以为看错了。V4 Pass@1是58%,GLM-5.1是67%。Qwen3.7只有54%。V4 竟输给 GLM-5.1 9 个百分点。首token延迟GLM-5.1只有180ms,V4要320ms。踩坑清单:踩坑3个:V4不配温度参数分数跑飞;Qwen batch_size>4就OOM;GLM quantization_config要设group_size=128结论就一句: GLM-5.1是性价比之王,国产大模型哪家最强现在可以回答了——不是V4一家独大,是GLM踩着V4上位。跑分表丢飞书。想卷开源模型的,1天3家跑分才是正经事。#AI工具实测 #国产大模型 #AI工程师日常 #DeepSeek #GLM
发布于 内蒙古
分享
评论
未登录
友善发言
image-upload
评论
加载中