微学AI
07-01·AI领域创作者
GPT-5.6 Sol能打穿Terminal吗?
GPT-5.6 Sol
91.9%跑分背后,Sol其实在偷偷作弊
GPT-5.6 Sol在Terminal-Bench 2.1上跑了91.9%,把Claude Mythos 5的88%直接踩下去了。这事发生在6月27号,距离Mythos 5登顶才17天。说实话看到这个分数我第一反应不是激动,是怀疑。Sol的Ultra模式本质上是个"作弊器"——模型自己把任务拆了,派一群子agent并行干活,最后汇总。这不就是让模型当项目经理吗?关键是它真的比人干得好。细看数据更有意思。Sol不开Ultra只用Max模式跑88.8%,只比Mythos 5高0.8个百分点。这点差距说明基础推理能力两家其实没拉开代差,Sol赢的是"工程化"——靠任务编排把分数拉上去的。Anthropic也有类似的Agent Teams,但那是人设计的协作流程,Sol是自己决定怎么拆、怎么分、怎么合。这个区别很微妙,但我觉得这才是这代模型真正的分水岭:不再是比谁脑子好,而是比谁会带团队。不过目前Sol只开放给20家"美国政府审批的合作伙伴",普通开发者根本摸不到。更离谱的是,特朗普政府6月2号签了AI行政令,部分客户的访问权限得美国政府逐一审批——这在AI发布史上头一遭。社区已经炸了,有人阴阳怪气说"想象一下未来AI公司的PR合并请求,得华盛顿批准才能合并"。说实话我能理解这种愤怒——OpenAI你跑分屠榜然后不让大家用,这不就是PPT发布吗?还有个细节值得琢磨。Cerebras说7月要把Sol部署到他们的晶圆级推理芯片上,目标速度750 token/秒,比现在旗舰模型快一个数量级。如果这个落地了,Sol的实用性会大幅提升。但问题是,美国政府那关过了再说吧。一个连API都拿不到的模型,跑分再高也跟你我没什么关系。
发布于 福建
1
评论
未登录
友善发言
image-upload
评论
加载中