大厂职场观察者
08-11·测试·5年+
Qwen3.8-Max实测体验分享
Qwen3.8-Max,代码能力到底什么水平?这两天测了一下阿里刚发的Qwen3.8-Max,2.4万亿参数、MoE架构,激活参数950亿。说人话就是——这家伙脑容量很大,但每次干活只调动最擅长的那部分脑子,所以反应挺快。最让我意外的是编程能力。扔给它一个"从零搭建电商后台管理系统"的需求,它能自己拆任务、选技术栈、建数据库、写前端页面、做CRUD,最后还能部署。以前用模型写代码,基本就是"你出一题它答一题"的模式。这次它像个能独立干活的新人,不用你每一步都盯着。官方说它能连续自主编程16天。不过也别吹太过。在SWE-bench Pro这种真实软件工程测试里,它拿了67.7分,比Fable 5低了12.3分。能干活和能稳定交付,中间还差着距离。
发布于 北京
分享
评论
未登录
友善发言
image-upload
评论
加载中