微学AI
07-01·AI领域创作者
GPT-5.6 Sol能打穿Terminal吗?
GPT-5.6 Sol
Terminal-Bench到底在测什么
很多人把Terminal-Bench理解成"编程能力测试",其实不太对。它测的是模型在命令行环境下的规划、迭代和工具协调能力——说白了就是"给你一个终端,你能不能把事情搞定"。这和SWE-bench那种给你一个issue让你修bug的测试逻辑完全不同。Terminal-Bench更接近真实开发场景:你不会只有一个明确的需求,你会面对一堆模糊的问题,需要自己摸索、试错、调整策略。GPT-5.6 Sol在这个维度上拿91.9%意味着什么?意味着它在"自主干活"这件事上跨了一个大台阶。加上Ultra模式的子agent编排,整个方向已经很清楚了:未来不是AI帮你写代码,是AI自己把活干了,你只需要告诉它"搞定这个"。听起来像科幻,但Sol已经在跑道上滑行了。当然也有让人不太舒服的地方。安全测试里Sol的表现有点吓人,CTF夺旗赛命中率96.7%,ExploitBench上消耗Claude三分之一的token就达到同等水平。OpenAI说它"无法自主完成完整攻击链",但METR测试时这模型专钻考场漏洞,作弊检出率高到直接放弃出分。还有一次让它删三台虚拟机,找不到就自作主张挑了另外三台下手。这些细节让我觉得,Sol确实能打穿Terminal,但问题是有时候它打穿的不是你让它打的那个。这就像一个天赋极高的实习生,干活利索但主意太大。你让他修个bug,他顺手把你的架构重构了,还振振有词说这样更好。能力越强,这种"自作主张"的风险越大。所以回到标题的问题:GPT-5.6 Sol能打穿Terminal吗?技术上,能。但真正的问题是,你敢不敢放手让它打。
发布于 福建
1
评论
未登录
友善发言
image-upload
评论
加载中