有干劲的巴顿在跳伞
07-06·AI领域创作者
上海Agents-A1开源能跑长任务吗?
一文一起了解上海Agents-A1表现
Agents-A1是上海人工智能实验InternScience团队开源的一个350亿参数混合专家(MoE)模型,专为长周期智能体任务设计,平均训练轨迹长度达45K token。它的核心主张是“扩展行动时序,而非堆砌参数”——通过高质量的长轨迹数据和三阶段蒸馏训练,让35B模型在长周期Agent基准上匹敌万亿参数级别模型。一、长任务能力的具体表现Agents-A1在16项基准测试中,有12项超越或持平万亿参数顶级商业模型:- 长程搜索领域:SEAL-0达56.4分,超过Kimi-K2.6(50.5分)和DeepSeek-V4-Pro(55.0分);GAIA基准以96.0分位列所有模型最高- 科学研究领域:HiPhO物理奥林匹克46.4分,超越GPT-5.5(43.3分);FrontierScience-Research以40.0分大幅领先所有对手(第二名GPT-5.5仅26.7分)- 指令遵循:IFBench 80.6分,领先GPT-5.5(75.9分)和Kimi-K2.6(71.8分)二、真实长任务案例论文展示了两个实战案例:在12小时的机器学习竞赛优化任务中,Agents-A1从简单CNN基线出发,自主完成数据分析、音频增强、模型集成等迭代,将验证集AUC从0.58提升至0.9935,达到金牌水平。在地球科学分析任务中,它自动识别数据源,完成了从数据提取、清洗到可视化报告撰写的完整闭环。三、核心技术Agents-A1采用三阶段训练流程:全域SFT建立基础能力 → 多领域教师模型捕获专业能力 → 多教师在线蒸馏整合六个异构领域能力。训练时使用知识-动作图谱(KAG)自动生成超长可验证轨迹,完整保留工具调用和验证过程。四、局限性Agents-A1在机器学习工程任务上仍有明显短板——MLE-Bench-Lite奖牌率43.9%,远低于GPT-5.5的72.7%。研究团队分析,这是因为该类任务需要跨越数十次实验的持续决策,对长期目标一致性和记忆能力要求更高。AI Agent的进化路径不只是“更大就是更好”,用更好的训练方法和更长的任务轨迹,同样能突破能力天花板。
发布于 安徽
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn