金燕
08-03 · 金燕外汇资管
GPT-5.6 Sol
大模型跑分低,可能只是“失忆了”同一个GPT-5.6 Sol,只改了两项API设置,ARC-AGI-3成绩从13.3%升到38.3%,输出Token反而减少到原来的六分之一。OpenAI发现,原评测环境每执行一步都会丢掉模型此前的推理过程,任务变长后还会直接删除早期记录。模型每走一步,都要重新理解规则,看起来就像“能力不行”。开启两项设置后,结果明显改变:保留推理过程:让Agent记住之前得出的规律和计划;上下文压缩:把长任务中的关键信息保留下来,而不是直接删掉旧记录。这件事说明,大模型评测测到的不只是模型能力,还包括提示词、上下文管理、工具接口和运行框架。一个没有记忆、不断丢失历史的Agent,再强也很难完成长任务。对普通用户同样有启发:AI长任务做不好时,问题未必是模型不够强,也可能是工作流没有保存过程、总结进度和复用中间结论。未来Agent产品的竞争,可能不只是“谁的模型更聪明”,而是谁能让模型持续记住自己做过什么。你觉得大模型排行榜,应该只比较模型本身,还是把运行框架也算进去?#GPT56 #AIAgent #人工智能 #大模型评测
发布于 广东
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn