小白学AI
06-30·AIGC算法·5年+
Grok 4.5内测性能接近Opus?
Grok 4.5
马斯克又放了个"卫星",但这次可能真的有点东西。xAI官宣Grok 4.5在SpaceX和特斯拉内部测试,综合性能对标Claude Opus。内测数据显示:HLE学术测评49.2%、MATH高阶数理96.1%,无限贴近Opus成绩;SWE-Bench代码修复78.3%,离Opus的87.6%仅剩不到10个百分点。但关键是Grok的差异化路线:依托X平台实时数据流做热点舆情,这是Opus的硬伤;绑定特斯拉、SpaceX工业场景闭环调优,走出了一条和通用大模型完全不同的路。当然也要清醒:超长合规卷宗研判、高精度多模态专业解析,Opus的优势依然稳固。"接近"是70分还是90分?是内部测试还是第三方盲测?答案还需要时间验证。你觉得这次是真材实料还是马斯克式营销?
发布于 上海
1
评论
1
未登录
友善发言
image-upload
评论
加载中