微学AI
06-25·AI领域创作者
千问世界模型能用来训Agent吗?
Agent训练的新基建
6月24号刷到Qwen-AgentWorld开源那天,我正卡在Agent怎么低成本训练的问题。原来RL只能跑真实环境,效率慢、奖励稀疏、token烧得心疼;阿里这次给了第二条路——把世界模型当"环境模拟器"用,让AgentWorld先预测下一步状态,Agent再决策,循环跑Sim RL,效果居然比纯真实环境训练还强,意味着RL范式要被改写。我盯论文看了一下午,发现它做了两件狠事:一是把"建模环境"从CPT阶段就纳入训练目标,不是事后补丁;二是用一个模型同时覆盖MCP、Search、Terminal、SWE、Web、OS、Android七大领域,GUI用XML/HTML/UI层级树替代像素,纯文本搞定视觉环境。对比之前WebWorld只覆盖Web、Snowflake的Agent World Model只能搞SQL,这次才是真正的"统一世界模型"。配套AgentWorldBench用9个成熟benchmark真实环境轨迹做评测,每个样本对齐真值,不是合成数据糊弄事。我已经pull到本地试跑35B-A3B,速度可接受,下一步想用它搭内部Agent的微调流水线。这东西不是玩具,是Agent训练的基建。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中