微学AI
06-25·AI领域创作者
千问世界模型能用来训Agent吗?
Claude Opus 4.8
Gemini 3.1 Pro
GPT-5.4
58.71分首超GPT-5.4
看到Qwen-AgentWorld-397B-A17B在AgentWorldBench以58.71分超过GPT-5.4(58.25)、Claude Opus 4.8和Gemini 3.1 Pro时,我愣了好几秒——这是个语言世界模型,不是聊天机器人,是专门给Agent训练当"环境模拟器"用的,凭什么能在通用模型为主的榜单上刷到第一?我翻来覆去看评测细节,发现AgentWorldBench的设计很聪明:用5个前沿模型在Tool Decathlon、Terminal-Bench 1.0/2.0、OSWorld-Verified等9个成熟评测集上的真实环境交互观测构建测试样本,每条都对齐真值,从格式、事实性、一致性、真实性、质量5个维度rubric打分。Qwen-AgentWorld赢的关键不是"多模态"——它纯文本——而是把环境建模从CPT阶段就内化为目标,靠10M+真实轨迹练出对下一步状态预测的"内化物理直觉"。这种范式一旦被验证,训练通用Agent就不必再在真实环境里硬碰硬了。同事说这次阿里开源的不只是一个模型,是Agent RL训练的新基建标准。
发布于 福建
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn