有干劲的巴顿在跳伞
08-14·AI领域创作者
GPT-5.6 Sol
Grok4.6发布!性能究竟如何?
Grok4.6实测:性能到底咋样
Grok4.6发了,马斯克这迭代速度是真的卷,两周更一版,别人还在测4.5呢,他4.6都出来了。我第一时间测了一下,说点真实感受。先说结论:性能确实追上来了,但还没到碾压的地步。跑分上,Artificial Analysis的智能指数拿了61分,跟GPT-5.6 Sol Max持平,比上一代4.5涨了5分。GDPVal-AA v2拿了1753分,甚至超过了Fable 5 Max和GPT-5.6 Sol。看着挺猛对吧?但实际用起来,感觉没跑分那么夸张。写代码方面,确实比4.5强了不少,复杂逻辑能写对了,注释也详细。但跟DeepSeek V4 Pro比,我觉得还是差点意思,特别是中文项目,Grok对中文注释和变量名的理解还是有点生硬。推理和数学方面,进步明显,以前4.5经常算错的题,4.6能做对了。但偶尔还是会犯低级错误,比如简单的算术算错,这个问题所有大模型都有,Grok也没解决。最让我意外的是价格。Grok4.6的API价格比GPT和Claude便宜不少,大概是对手的一半。考虑到性能已经追平了,这个性价比是真的高。但有个问题,Grok的中文能力还是弱项。我测了几个中文写作任务,写出来的东西总有点翻译腔,不如国产模型自然。如果你主要做中文任务,DeepSeek和Qwen可能更合适。总结一下:Grok4.6是个好模型,性价比很高,英文任务和代码任务值得一试。但别被跑分忽悠了,适合自己场景的才是最好的。你们有人测Grok4.6了吗?跟其他模型比感觉咋样?评论区说说。
发布于 安徽
分享
评论
未登录
友善发言
image-upload
评论
加载中