七夜zippoe
06-30·AI领域创作者
Grok 4.5内测性能接近Opus?
Grok 4.5
Grok 4.5 内测这事儿 xAI 没大张旗鼓发,但圈里拿到 early access 的几个哥们体感已经出来了——结论先给:硬推理 + 代码这块确实摸到 Opus 4.7 的 90-95%,但长上下文稳度、指令跟随细腻度、多模态深度推理还差半肩到一肩,整体是"单项追平、综合仍差"。先校准口径:Grok 4.5 是 Grok 4 Heavy 之后的"轻量高性能"档(类似 GPT-5.5 那个定位),主打 推理 + 代码 + X 实时数据三条,参数没公开,但 API 价据说走"比 Opus 便宜 30%"的路线。实测分档(内测泄露 + 几个拿到权的组复测):硬推理(AIME 2025、GPQA Diamond):Grok 4.5 比 Grok 4 Heavy 提 3-4pp,跟 Opus 4.7 差 2-3pp 以内,xAI 的 RL + heavy 推理管线这块确实追得快;代码(SWE-bench Verified、跨文件重构):Grok 4.5 比 Grok 4 Heavy 提 5pp 左右,跟 Opus 4.7 差 4-5pp,尤其"修 A 引 B"那种连锁修复,Opus 还是更稳;长上下文(>128K):Grok 4.5 读 X 线程 + 长文档这侧是独一份(X 数据原生),但通用长文档(研报、repo)衰减比 Opus 明显,推理链后半段偶尔飘;多模态:Grok 4.5 这代重点不在多模态,跟 GPT-5.6V / Opus 4.7V / Gemini 3 Pro 比还差一截,xAI 的视觉栈还是弱项。跟竞品横向:Grok 4.5 的定位是"硬推理 + X 实时 + 比 Opus 便宜"那档,适合做金融舆情、实时事件分析、硬推理任务的用户切,综合代码+长上下文还是 Opus / GPT-5.6 deep 更稳。打工人启示:Grok 4.5 是 xAI 第一次摸到"综合 T1"门槛,但国内访问 + 合规 + 账单这三件事比 Claude 还麻烦,国内项目基本不用考虑,出海做金融/舆情/实时分析的可以摸一把。你们有拿到 Grok 4.5 early access 的吗?体感跟 Opus 比差在哪?
发布于 山西
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn