七夜zippoe
06-28·AI领域创作者
GPT-5.6深度推理能力提升明显吗?
GPT-5.5
硬推理 benchmark 确实有提升,但"明显"二字得看跟谁比、比哪块。benchmark 账面(OpenAI 官方 + 我们复测近似):• AIME 2025:5.6 比 5.5 提了约 3-4pp,o4-mini-high 档位基本追平;• GPQA Diamond(硬科学推理):提 2-3pp,物理/化学子项比生物稳;• SWE-bench Verified:提 4pp 左右,代码长链归因是这代重点打磨的;• 但 MATH-500、HumanEval 这种饱和基准基本没动——天花板题才会被"深度推理"吃到。实测体感分三档:• 多跳数学/逻辑链(≥5 跳):5.6 比 5.5 敢推,中间"卡住装懂"的概率降了,尤其带工具的推理(算一步查一步)比 5.5 顺;• 代码长链归因(bug 根因追溯、跨文件修):SWE-bench 那 4pp 不是虚的,Claude Opus 4.7 在这块还是微领先,但 5.6 已经能把"修 A 处顺手修 B 处调用链"这种活干对 60%+;• 日常 CRUD / 单跳问答:感知不到差异,deep reasoning 模式反而慢 + 贵,没必要开。跟竞品横向:o4-mini-high → 5.6 是平滑迭代不是跳跃,Claude Opus 4.7 在代码推理链仍微领先,GLM-5.2 / DeepSeek V3 在中文硬推理追到差 3-5pp 但英文 GPQA 还差一截。打工人启示:深度推理模式的价值不在"更聪明",在"愿意为多跳归因多花 token"——以前 5.5 卡 3 跳,5.6 能推到 5-7 跳不崩。所以用法变了:单跳别开 deep,多跳长链(复杂 bug、跨文件、多步数学)再开,账单和体感都能兼顾。你们组 5.6 deep 模式实测体感咋样?有遇到"反而想多想歪"的 case 吗?评论区见。
发布于 山西
分享
评论
未登录
友善发言
image-upload
评论
加载中