微学AI
07-06·AI领域创作者
上海Agents-A1开源能跑长任务吗?
堆任务比堆参数更重要
这个夏天国产开源AI最让我兴奋的,不是哪家又刷了某个榜单,而是上海AI Lab丢出来的Agents-A1。35B的MoE模型,参数只有对手三十分之一,却在FrontierScience-Olympiad拿到79.0分,超过了Kimi K2.6的73.0和DeepSeek-V4-pro的76.0两个万亿级对手。在长程搜索SEAL-0拿到56.4、物理奥赛HiPhO 46.4、指令遵循IFBench 80.6,几乎在所有"长链路"基准上压过同尺寸选手。但让我真正停下来想想的是它的论文标题: 《Scaling the Horizon, Not the Parameters》 。这一年大家都被参数军备竞赛裹挟,好像模型做不大就输在起跑线。Agents-A1反向走:不把模型做大,而是把训练样本里的"推理轨迹"做长。团队构建了一套叫KAG(知识-动作图)的基础设施,把外部知识、动作、观察结果、验证器判定串成可训练的长轨迹,平均长度4.5万token。常规SFT样本只有几千token,相当于它喂给模型的不是"题目+答案",而是"完整解题录像"。三阶段训练:全领域SFT打底→四个领域教师(搜索、科学、指令、工具调用)→多教师按领域路由的on-policy蒸馏,把多专家能力压进一个35B学生模型。我个人感受是:这种路线更接近"培养习惯"——o1证明"多想"有用,Agents-A1更进一步,把"怎么想"教进训练数据本身,让模型在长链路里能稳住约束、不被错误累积。35B能在我自己机器上稳定跑长任务,这才是工业落地的关键。
发布于 福建
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn