雪咤
06-29·全栈工程师·5年+
GPT-5.6 Sol
GPT-5.6实际体验咋样?
GPT-5.6跑分91.9%是真的猛
GPT-5.6 Sol Ultra在Terminal-Bench 2.1上拿了91.9%,标准版Sol是88.8%,Claude Mythos 5是88%,Gemini 3.1 Pro只有70.7%。这个跑分什么概念?Sol Ultra比GPT-5.5的编程上限又拉高了一截,而且第一次在智能体编程能力上超越了Anthropic Mythos系列。SWE-Bench Pro预估突破75%以上,这是编程Agent的里程碑数据。OpenAI首席科学家Jakub Pachocki说这是比GPT-5.5有意义的改进,不是小修小补。但跑分归跑分实际体验是另一回事,我用了三天最真实的感受是能力确实强但慢得离谱。以前GPT-5问个问题秒回,现在让它干复杂任务单次响应两到五分钟是常态。它不是卡了是在想加做,Agent模式下会反复搜索执行验证。能力强是真强但你要有耐心等它思考。
发布于 广东
分享
评论
1
未登录
友善发言
image-upload
评论
加载中