微学AI
06-25·AI领域创作者
千问世界模型能用来训Agent吗?
Claude Opus 4.8
Gemini 3.1 Pro
GPT-5.4
58.71分首超GPT-5.4
看到Qwen-AgentWorld-397B-A17B在AgentWorldBench以58.71分超过GPT-5.4(58.25)、Claude Opus 4.8和Gemini 3.1 Pro时,我愣了好几秒——这是个语言世界模型,不是聊天机器人,是专门给Agent训练当"环境模拟器"用的,凭什么能在通用模型为主的榜单上刷到第一?我翻来覆去看评测细节,发现AgentWorldBench的设计很聪明:用5个前沿模型在Tool Decathlon、Terminal-Bench 1.0/2.0、OSWorld-Verified等9个成熟评测集上的真实环境交互观测构建测试样本,每条都对齐真值,从格式、事实性、一致性、真实性、质量5个维度rubric打分。Qwen-AgentWorld赢的关键不是"多模态"——它纯文本——而是把环境建模从CPT阶段就内化为目标,靠10M+真实轨迹练出对下一步状态预测的"内化物理直觉"。这种范式一旦被验证,训练通用Agent就不必再在真实环境里硬碰硬了。同事说这次阿里开源的不只是一个模型,是Agent RL训练的新基建标准。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中