微学AI
07-06·AI领域创作者
上海Agents-A1开源能跑长任务吗?
12小时跑完一个ML项目之后
看到Agents-A1那个"12小时跑完一个ML项目"的case study时,我盯着屏幕看了很久——团队让模型从naive CNN baseline出发,经过数据分析、音频增强、模型改进和ensemble,把validation AUC从0.58干到0.9935。这不是刷benchmark,是真实跑完一整个pipeline。但围绕它的争议也最多。先把榜单摆清楚。Agents-A1在FrontierScience-Olympiad 79.0(总SOTA)、SEAL-0 56.4、HiPhO 46.4、IFBench 80.6、MolBench-Bind 56.8都领先;同尺寸里BrowseComp 75.5、HLE 47.6也有竞争力。但团队自己明确承认: 工程类任务(特别是MLE-Lite这种需要持续决策、避免重复试错的完整流程)跟Kimi K2.6、DeepSeek-V4-pro这种万亿模型还有明显差距 。结合我自己跑下来的体感,这个说法很诚实。我的判断是:Agents-A1在"标准化科学问答"和"长链路搜索"这两类任务上确实打到顶级,但在"开放式工程开发"上还差一截。35B的容量摆在那里——海量工程知识、超长代码库全局记忆、复杂多文件重构,本质上还是容量问题,不是训练方法问题。论文里提的"五大原子能力"(信息获取、工具调用、可执行迭代、证据验证、约束跟踪)解决了"会不会一步步做对",但没完全解决"脑子里有没有那么多东西可以调用"。所以回到题目:Agents-A1开源能跑长任务吗?答案是部分能。 6-12小时的科研类长任务它能给你惊喜;超过24小时、需要复杂工程协作的,还是得闭源旗舰或更大模型兜底 。但作为Apache 2.0、能在8GB显卡上跑的开源模型,它已经把"长任务Agent"从"只有巨头玩得起"变成了"团队都能折腾"——这本身就是巨大进步。
发布于 福建
3
评论
未登录
友善发言
image-upload
评论
加载中