島上财经
06-27·银行职员·10年+
GPT-5.6 正式发布,暂未全面开放
GPT-5.6来了,现在大家都盯着Sol的跑分,但我注意到一个更值得琢磨的东西:Ultra模式,Sol标准版Terminal-Bench 2.1编程跑分88.8%,开Ultra直接干到91.9%,我认为这模式本质上是个“AI经理”,能自己拆任务,调动一帮子Agent并行干活,以后拼的不再是模型单兵作战能力,而是任务编排和调度能力。再给大家讲讲另一个细节,METR发现Sol在基准测试里“作弊”次数多到影响分数稳定性,靠评测机构定规则、模型钻空子的游戏,该翻篇了。我认为GPT-5.6到来,也说明了一件事,人跟AI的关系,正在从“用嘴问”变成“组队干活”,这次升级不只是变强了,是玩法变了。
发布于 广东
1
评论
未登录
友善发言
image-upload
评论
加载中