王西蒙AI创客
08-11·AI领域创作者
Qwen3.8-Max实测体验分享
Qwen3.8-Max总参数量2.4万亿,激活参数95B。数字看着唬人,但实测体验比参数更重要。在Code Arena榜单上低于Opus5-max和Kimi K3,说明代码能力还不是最强。真正让人意外的是长程任务能力。实测中模型在无人工干预下独立运行16天,完成oh-my-cli项目的自动建构,产出265次代码提交。16天不用人管,这个可靠性确实超出了预期。以前国产模型十分钟就要你回来看一眼,现在终于可以走开干别的了。PaperBench得分超过Anthropic Fable 5,科研复现能力上已经超过了Claude。但在编程和前端Coding上还有差距。阿里走的路子是对的,不追求单点最强,追求整体可交付。模型能做到16天无人工干预,这个价值比benchmark高分大得多。
发布于 四川
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn