微学AI
07-01·AI领域创作者
GPT-5.6 Sol能打穿Terminal吗?
GPT-5.6 Sol
91.9%是怎么打穿的
GPT-5.6 Sol 在 Terminal-Bench 2.1 上以 ultra 模式跑出 91.9%,刷新所有已公开模型纪录,这个数字让我第一次在屏幕上停住了滚轮。Terminal-Bench 2.1 的 89 个任务不是写个 sort 算法返回正确结果那么简单,它把模型扔进一个真实容器里——读文档、装依赖、起服务、跑测试、查日志、失败重试,整条链路几乎是我每天在 IDE 里手搓的活儿。两周前 Claude Mythos 5 的 88.0% 刚被各路媒体封为"agentic 编程新天花板",Sol 一出手就被踩在脚下;更狠的是关掉 ultra 只用 max 模式,Sol 仍有 88.8%,相当于旗舰机开省电模式都能赢别家的性能模式。但真正让同行后背发凉的,不是分数本身,是效率——ExploitBench 上 Sol 几乎打平 Anthropic 那个"强到不敢发布"的 Mythos Preview,输出 token 却只有三分之一;CTF 命中率 96.7%,几乎触顶。这背后是两项新机制:max reasoning effort 给模型更多推理链预算,ultra mode 则让 Sol 自己把任务拆给多个子 agent 并行处理再合并结果,区别于 Anthropic 需要人工编排的 Agent Teams——这是模型自己当 PM 了。91.9% 不是一个冰冷的 SOTA,它在告诉我:终端里"干完一件事"的成本正在塌方式下降。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中