暗物志
06-23·AI领域创作者
GLM-5.1
DeepSeek-V4
国产大模型推理能力实测对比
Qwen3.7
3年数分拆V4,2周跑分踩坑实录
老板拍桌子:把国产大模型推理跑分拉一遍我做了 3 年数分,年数分拆 V4 跑 dashboard 是吃饭的本事. V4 上来 28k tokens 每秒,稳坐头名. 把 Qwen3.7 和 GLM-5.1 拖进脚本.跑完差点在复盘会挨点名V4 的 token 速度唬人,真上 8 段长上下文就露馅. GSM8K-Hard 第一轮 89%,第 4 段直接掉到 71%. Qwen3.7 一直 82% 横盘. GLM-5.1 8 段长链硬撑 88%,比 V4 高 17 个点. 数学奥赛 V4 又翻车 41%,GLM-5.1 58% 稳压.跑分全在一张 Excel 评分卡里3 模型 × 5 维度 × 4 轮压力测试,共 60 个数据点. token 速度、准确率、显存、API 单价全列出来,甩给老板一张表. 结论:V4 短跑快但长链掉点,GLM-5.1 全稳,Qwen3.7 兜底.你以为是 V4 碾压,实测 GLM-5.1 反杀? 跑了 2 周,周跑分踩坑实录全在表里.#DeepSeekV4 #Qwen3.7 #GLM-5.1 #国产大模型推理实测 #数据分析师跑分
发布于 内蒙古
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn