渣渣盟
08-18·AIGC算法·1年以下
Grok4.6发布!性能究竟如何?
Grok 4.6深度评测
北京时间8月12日晚,SpaceXAI正式发布Grok 4.6。距离上一代Grok 4.5仅一个多月。这次升级让人眼前一亮——三个月前还在榜单第17名晃悠,现在直接冲到了第一梯队。硬指标:追平GPT-5.6 Sol MaxArtificial Analysis智能指数AAII上,Grok 4.6拿到61分,与GPT-5.6 Sol Max持平,仅落后于Claude Fable 5 Max的62分。相比Grok 4.5的56分,一个月涨了5分。具体到各个维度:| 测试 | Grok 4.5 | Grok 4.6 | 提升 || -------------- | -------- | -------- | ------ || DeepSWE v1.1 | 54% | 65.9% | +11.9% || APEX-Agents | 47.1% | 57.5% | +10.4% || Terminal-Bench | 15.7% | 26% | +10.3% |在智能体知识工作测试GDPVal-AA v2中,Grok 4.6拿到1753分,超过Claude Fable 5的1741和GPT-5.6 Sol的1728。法律领域Harvey LAB测试更夸张——15.8%对GPT-5.6 Sol的2.5%。价格:不到竞品一半API定价:每百万输入Token 2美元,每百万输出Token 6美元。GPT-5.6 Sol是5美元输入、30美元输出。性能追平,价格只有三分之一。另有高速版本,价格为普通版2倍。“长时间运行的AI智能体”是最大亮点以前的AI模型你问一句它答一句。Grok 4.6不一样——给它一个模糊的产品想法,它能自己研究、设计架构、写代码、跑测试、发现问题、改代码,最后交付一个能跑的第一版。整个过程不需要你每一步都下指令。短板也得说:终端操作Terminal-Bench只有26%,对手都在34%左右。软件工程DeepSWE 65.9%也落后于GPT-5.6 Sol的73%。我的判断:Grok 4.6证明了不堆参数也能追平第一梯队。加上价格优势,对预算敏感的开发者和团队来说,这是目前最具性价比的前沿模型之一。
发布于 天津
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn