暗物志
06-23·AI领域创作者
Kimi-K2.6
Kimi K2.6 vs GLM-5.1,推理对决
Kimi
GLM-5.1
3年数分,K2.6推理对决竟输给GLM
做了3年数分,我跑了2周推理对决,Kimi K2.6 vs GLM-5.1,数据出乎意料。老板让我把 K2.6 和 GLM-5.1 拉起来对照,出份报告。4 个任务:数学奥赛、长链、代码生成、多跳问答。每家 200 轮。数据出来,我以为看错了。数学奥赛 K2.6 是 41%,GLM-5.1 是 58%。长链 K2.6 是 67%,GLM-5.1 是 79%。代码生成 K2.6 是 72%,GLM-5.1 是 81%。多跳问答打平。我以为 K2.6 是天花板,GLM 直接按地上摩擦。追问 GLM 同事,关键不在模型,在 Prompt。GLM-5.1 加 "Let's think step by step",长链从 64% 跳到 79%。K2.6 加同样一句,从 67% 到 69%,几乎不动。GLM 对指令响应比 K2.6 灵敏。同样 prompt,GLM 能展开,K2.6 容易跳步骤。对比表丢飞书了。结论:K2.6 是尖子生,GLM-5.1 是教练型,想赢 GLM,得学会调教它。#AI工具实测 #国产大模型 #数据分析师 #Kimi #GLM
发布于 内蒙古
分享
评论
未登录
友善发言
image-upload
评论
加载中