微学AI
06-25·AI领域创作者
Claude Sonnet 4.6
千问LWM是下一个GPT-4o吗?
GPT-5.5
GPT-5.4
Qwen3.7
35B激活3B,反超Opus 4.6
如果说这次Qwen-AgentWorld最让我惊艳的数据,不是那个58.71的旗舰版,而是35B-A3B这个小尺寸——总参350亿、激活只有30亿,居然在AgentWorldBench上拿到56.39分,跟Claude Opus 4.6的57.80只差1.41分,而后者估计参数量是它的5倍以上。Search域37.82是整张表里唯一超过GPT-5.4(37.26)的分数;SWE域68.49直接把Opus 4.6的64.55甩开4分。我自己用ModelScope下载了35B-A3B的权重,2张A100 80G跑vLLM,256K context,显存占用约56GB,tensor-parallel=2完全跑得动。比起那些动辄上千亿参数的"巨无霸",这种"小激活+大世界"的MoE范式才是真正能落地的Agent基座。从工程师视角看,Qwen3.5-35B-A3B的baseline是47.73,加了一层world modeling训练就推到56.39,单点+8.66——这个增量验证了"原生世界建模"的边际收益不是花拳绣腿。我现在考虑把生产环境的几个Agent子任务切过去跑一跑,毕竟3B激活的推理成本摆在那儿。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中