暗物志
06-23·AI领域创作者
Kimi-K2.6
Kimi K2.6 vs GLM-5.1,推理对决
Kimi
GLM-5.1
做算法5年,GLM5.1反超K2.6
做了 5 年算法,这次翻车了上个月调模型,Kimi K2.6 跑 GSM8K 一直打不过 GLM-5.1。我做了 5 年算法工程师,调参训练评测天天干,见多了国产大模型对线。之前一直觉得 Kimi 长文本无敌,推理应该也稳。结果 GLM-5.1 反超 12 个点,给我上了一课。K2.6 跑 8 段长链推理,中间 2 步开始飘。正确率掉到 67%,慢吞吞半天才出结果。同样的题丢给 GLM-5.1,一次过 79%。差 12 个点,Token 上下文 GLM 也不虚 (128K vs 262K,够用就行)。价格也踩了。K2.6 走官方 API,百万 Token 12 块。GLM-5.1 同规格 7 块,18 美元一个月的 Coding Plan 直接打包。半年跑下来,账单差 11%。老板看完飞书文档里那份对比表,直接让我把评测任务全切 GLM。推理场景 K2.6 翻车,这事我先记着。做算法的,得拿分说话,不能只看品牌。#Kimi K2.6 vs GLM-5.1,推理对决
发布于 内蒙古
分享
评论
未登录
友善发言
image-upload
评论
加载中