微学AI
06-25·AI领域创作者
千问LWM是下一个GPT-4o吗?
Decouple与Unify的范式跳跃
我看完整篇Qwen-AgentWorld的技术报告和GitHub README,我最大的感受是他们这次把"原生"两个字玩明白了。传统Agent训练是RLHF之后再补一个reward model,世界建模是事后补丁;Qwen-AgentWorld直接把"下一状态预测"作为CPT阶段的训练目标,贯穿CPT→SFT→RL全流程,模型从"出生"就内化环境动力学。更关键的是它支持两种使用范式:Decouple(解耦)是把LWM当环境模拟器,让Agent在纯模拟环境里跑RL,支持上千个环境的可扩展训练,论文里说在OOD任务上能反超真实环境训出来的policy;Unify(统一)是把world model训练当Agent基础模型的预热,直接提升7个下游Agent任务成绩,不需要任何RL微调。我个人觉得Decouple这条线更有想象力——以前训练Agent要搭环境、维护真实交互链,又慢又贵;现在让LWM自己生成下一状态,等于给Agent一个"脑内沙盘",推理成本可控、可注入扰动、能无限跑rollout。当然论文自己也强调,LWM不是替代真实环境,而是互补路径。AGI这条路光靠模拟推演不够,但少了这一块一定走不远。
发布于 福建
分享
评论
1
未登录
友善发言
image-upload
评论
加载中