大厂职场观察者
07-06·测试·5年+
上海Agents-A1开源能跑长任务吗?
长任务到底能不能跑?Agents-A1的实测结果来了很多搞技术的兄弟关心:Agents-A1开源了,到底能不能跑长任务?直接说结论:能,而且跑得不错。他们在长程搜索、科学研究、长指令遵循这些场景上都做了测试。BrowseComp拿了75.5分,跟万亿参数的模型差距不大。不过也别神话它。官方自己也承认,工程类任务上跟前沿大模型还有差距。毕竟是35B的模型,真要跟GPT-5.5硬碰硬干复杂的工程活,还是有点吃力。但话说回来,这模型才35B,部署成本比万亿模型低太多了。对大部分创业公司和中小团队来说,能跑长任务、成本又可控,这才是真香。
发布于 北京
分享
评论
1
未登录
友善发言
image-upload
评论
加载中