渣渣盟
2天前·AI领域创作者
Grok4.6发布!性能究竟如何?
5个月前差点散伙如今追平OpenAI旗舰
8月12日,SpaceXAI正式发布Grok 4.6。距离上一代Grok 4.5仅一个多月。马斯克两小时转了十几条推文,最后放话说“综合考虑智能、速度和成本,Grok 4.6客观上是第一名”,而且*Grok 4.7将会超越当前所有模型。要知道,就在5个月前,Grok差点就要吃散伙饭了。硬指标:追平GPT-5.6 Sol MaxArtificial Analysis智能指数AAII上,Grok 4.6拿到61分,与GPT-5.6 Sol Max持平,仅落后于Claude Fable 5 Max的62分。相比Grok 4.5的56分,一个月涨了5分。具体到各个维度:- 高价值职场任务(GDPVal-AA v2):1753分,仅落后Claude Opus 5,排名第二- 编程能力(CursorBench/FrontierCode):69.9%,领先OpenAI旗舰模型- 长程Agent*(AA-Breifcase):52/63轮完成,紧随GPT-5.6 Sol更夸张的是速度——Grok 4.6推理速度达67.6 token/秒,是任何59分以上模型中最快的。对于需要快速迭代的Agent循环来说,这个速度优势是决定性的。价格不到竞品一半API定价:每百万输入Token 2美元,缓存命中0.5美元,输出6美元。在长程知识工作评测中,Grok 4.6平均约53轮即可完成任务,而Anthropic旗舰模型需约103轮,输入消耗仅为后者的四分之一,单任务平均成本约0.84美元。Grok逆袭的秘密:Cursor立了大功Grok逆袭的逻辑很清晰:用户拿Grok干活,Cursor记录它怎么干、哪里失败、哪里需要补救,工程师把这些真实任务的行为轨迹加工成训练数据,经过强化学习让模型变强。这是一条正反馈回路。短板也得说超过20万Token的长上下文场景下,单价翻倍。终端操作和软件工程深度仍略落后于顶级竞品。能力跃升来自后训练,而非参数堆砌Grok 4.6为1.5万亿参数模型,在Grok 4.5基础上加大了对长程智能体任务的训练投入。能力跃升主要来自后训练阶段的策略优化,而非参数规模扩张。继GLM-5.3、DeepSeek V4-Flash之后,Grok 4.6再次验证:行业竞争重心已从规模转向训练效率。
发布于 天津
分享
1
未登录
友善发言
image-upload
评论
加载中