制造七条猫
08-14·AI领域创作者
GPT-5.6 Sol
Grok 4.6
Grok4.6发布!性能究竟如何?
Grok4.635天追平GPT-5.6
8月12日上线的Grok 4.6,沿用Grok 4.5的1.5T参数底座,把35天全砸在SFT轨迹重生成+智能体强化学习上——结果AA Intelligence Index从56直接拉到61,追平GPT-5.6 Sol,距Claude Opus 5(63)只差2分,xAI重回前沿第一梯队。真正强在哪:知识工作与长程Agent📊 知识工作榜单小胜GDPVal-AA v2 Elo 1753,不仅比Grok 4.5的1526暴涨227分,还小幅领先Claude Fable 5的1741和GPT-5.6 Sol的1728,同级竞品知识工作榜首。AA-Briefcase长程办公任务1577 Elo,同样位列榜首。法律专业推理Harvey LAB拿到15.8%,大幅甩开Fable 5的11.3%。🤖 长程任务"省力"是隐藏大招AA-Briefcase实测中,Grok 4.6平均约53轮、5亿输入token跑完任务,Claude Opus 5 Max要103轮、20亿token。同样一件事,它用一半的步数交差——这对按token计费的Agent生产环境,意味着成本直接砍半🔧 编码Agent全面跃升DeepSWE从54%→65.9%、APEX-Agents从47.1%→57.5%、Terminal-Bench从15.7%→26%,相对4.5都是两位数提升但有三个"没赢"必须说清楚⚠️ 别被"追平GPT-5.6"的标题骗了:综合指数打平≠各项都赢• 纯编码峰值仍落后:DeepSWE 65.9% vs GPT-5.6 Sol 73%,差7个点;Terminal-Bench 26% vs 34.6%,仍垫底• 综合智力排第三:AA Index榜上,Claude Opus 5(63)> Fable 5(62)> Grok 4.6 = GPT-5.6 Sol(61)• 200K上下文是计费悬崖:超过20万token,整条请求输入价从2飙到4、输出从6到12,必须配prompt cache key才压得住Agent成本📌 给技术管理者的判断:xAI用4.6证明了一件事——前沿模型的进步不一定靠堆参数,后训练+智能体RL也能在一个月内追平对手一年积攒的身位。这意味着模型选型别押死单一供应商,谁能按月迭代、谁的后训练飞轮转得快,谁才是长期赢家
发布于 江苏
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn