五、长上下文与高推理强度,并不能解决根本问题评测结果显示:无法处理长上下文的模型,表现确实更差
但即便能处理长输入、严格遵循指令,仍会在大量任务中失败提高推理强度对部分任务有帮助,但提升幅度有限,且不稳定。这表明:上下文学习并不是“读得更久、想得更久”就能解决的问题。六、归纳能力缺失,是当前模型最明显的短板在 CL-bench 的几类任务中,模型在“演绎型任务”(按明确规则执行)上的表现明显好于:从实验数据中发现规律
从环境反馈中总结结论后者往往需要归纳能力,而这一能力在当前模型中表现最弱,部分任务成功率低于 10%。七、无污染设计,暴露了上下文学习的真实下限CL-bench 采用了严格的无污染设计:大量虚构体系
对现实规则的系统性改写
小众或新兴内容在不提供任何上下文的情况下,模型的成功率几乎为零。 这说明模型无法通过“记忆猜测”完成任务,必须依赖上下文学习。同时,超过一半任务存在强序列依赖,进一步放大了学习失败的后果。八、对工程实践的启示:Context 并不是“给了就能用”对做系统的人来说,CL-bench 的结论非常直接:上下文不是外挂知识库
Prompt 不是学习机制
Agent 并不会自动“看文档做事”如果模型不能稳定地从上下文中学习,新一代智能系统在复杂场景下仍然会频繁失效。九、大模型“如何记忆”,正在成为系统级问题腾讯混元团队在结语中提出一个判断:大模型如何从上下文中保留、组织和巩固知识,可能会成为下一阶段的核心研究方向。当模型的上下文学习能力变得可靠之后,人类在系统中的角色也会发生变化—— 从训练数据提供者,转变为上下文构建者与任务设计者。人工智能技术学习交流群
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。