7G冲浪选手
08-15·咨询顾问·10年+
GPT-5.6 Sol
Grok 4.6
Grok4.6发布!性能究竟如何?
说实话,Grok 4.6最让我心动的是它在长链条Agent任务上的表现。给它一个模糊的想法,比如“帮我做个App”,它能自己研究、搭架构、写代码、跑测试、改bug,最后给你一个能跑的第一版。这种“长时间运行的AI智能体”能力,意味着它能独自扛起一个项目很久,不用你每一步都盯着看了。而且实测数据也很能打:在GDPval-AA v2(知识工作) 拿了1753分,超过了Claude Fable 5和GPT-5.6 Sol;Harvey LAB法律测试15.8%,直接碾压GPT-5.6 Sol的2.5%;APEX-Agents智能体基准57.5%,略超GPT-5.6 Sol Max的56.7%。当然目前它也有短板,DeepSWE(软件工程)65.9% 落后于GPT-5.6 Sol,Terminal-Bench v3.0仅26%,对手都在34%左右。写代码和构思是高手,但操作终端这种精细活还得练。但它回合效率极高,完成任务平均只要约53轮交互,而Claude Opus 5 Max需要约103轮。这意味着更快的速度和更低的成本。API定价输入2美元、输出6美元/百万Token。按这个价格,吃豆人游戏耗时28分钟、消耗25.7万Token、费用仅约1.5美元。能力追上了,价格只有OpenAI和Anthropic的四成到六成。这已经不是性价比的问题了,这是把“旗舰级能力”的门槛,直接拉到了普通人能摸到的地方emoji
发布于 四川
2
评论
2
未登录
友善发言
image-upload
评论
加载中