微学AI
07-13·AI领域创作者
GPT-5.6 Sol Ultra 证明数学猜想
Ultra模式重塑SOTA
作为一直在盯Terminal-Bench 2.1的人,看到Sol Ultra 91.9%这个数字我第一反应是翻榜单。Standard Sol 88.8%,开启ultra模式直接跳到91.9%——3.1个百分点在这种level的benchmark上堪称离谱。我把关键排名拉成对照表:Artificial Analysis Coding Agent Index v1.1上Sol max模式80分,比Claude Fable 5(77.2)高2.8,输出Token只有对手一半、耗时不到一半、成本只有三分之一;Agents' Last Exam上Sol 53.6对Fable 5的40.5,+13.1分的代差是碾压级;FrontierMath v2 Tier 4上Sol 83%对Claude Opus 4.8的31.25%,是研究级数学的硬碰硬;BrowseComp 92.2%、OSWorld 2.0 62.6%——7月9日GA以来Sol基本把"前沿"这个词从Claude手里抢了过来。但91.9%背后的故事更值得讲。Ultra不是"让模型想更久"那么简单,而是一种全新推理架构:主模型做编排器,spawn出最多64个独立subagent并行干活,每个专注一个子问题,最后汇聚剪枝。我自己用Sol Ultra跑过一次大规模代码重构,4个subagent并行扫不同模块,效率是单agent的3-4倍。代价是Token消耗按数量线性放大,单次$2.67起。
发布于 福建
1
评论
未登录
友善发言
image-upload
评论
加载中