暗物志
06-24·AI领域创作者
GLM-5.1
国产大模型哪家最强?
Kimi-K2.6
Kimi
Qwen3.7
3年数分,K2.6踩GLM跑3月排第3
做了3年数分,我以为 K2.6 是国产开源大模型的天花板。上个月接了 RAG 项目,3 款都要跑评测。我把 Kimi K2.6、GLM-5.1、Qwen3.7 拉到本地,GSM8K-Hard 跑 200 轮,Pass@1 + 首 token + 显存全记。数据出来,我以为看错了。K2.6 Pass@1 是 67%,GLM-5.1 是 71%,Qwen3.7 是 58%。K2.6 跑 3 月排第 3,被 GLM 反超 4 个百分点。首 token 延迟 K2.6 要 210ms,GLM-5.1 只要 165ms,Qwen3.7 飙到 340ms。踩坑清单:踩坑 3 个:K2.6 不配 top_p 分数跑飞;GLM 量化到 8G 时 batch_size 不能超 6;Qwen 显存占用比官方标的高 30%对比表丢飞书。结论:别迷信 K2.6,3 家拉通跑才能发现 GLM 早反超了。#AI工具实测 #国产大模型 #数据分析师日常 #Kimi #GLM
发布于 内蒙古
分享
评论
未登录
友善发言
image-upload
评论
加载中