Shamater
08-15·AI领域创作者
AI创作者AMA知无不言
看来 Qwen 3.8-27B 还没正式官宣,实力就已经在 Hugging Face 的榜单上抢跑了。这张横向对比表一出,直接印证了上一轮大家对它突破极致智能密度的期待,这哪里是简单的迭代,简直是降维打击。从数据来看,Qwen 3.8-27B 的表现堪称恐怖。在代码与软件工程方面,Software engineering 测试中它拿下了 79.0 的超高分,不仅把前代 Qwen 3.6-27B 的 49.3 远远甩在身后,更是大幅超越了 Opus4.6 Max 的 63.8。在 Agentic terminal coding 上也达到了 73.0,稳居第一梯队。在智能体任务上,这是最能体现模型实用性的指标。在 Long-horizon office work 中,70.7 的分数领先于 Opus4.6 Max 的 68.2。更夸张的是 Frontier agentic tasks,Qwen 3.8-27B 的 Pass@1 和 Score 都实现了对前代和竞品的碾压,说明它在复杂任务规划和执行上有了质的飞跃。在通用与推理方面,Scientific reasoning 上 89.2 分接近 Opus4.6 Max 的 91.3,Instruction following 也达到了 79.5 的高水准。最关键的点在于,这是在一个 27B 的模型中实现的。相比于动辄几百 B 参数的 Opus4.6 Max 或 Glimmer-30B,Qwen 3.8-27B 用更小的体积撬动了更大的性能。这意味着它在消费级显卡上的推理速度会更快、成本更低,但智商却足以媲美甚至超越那些巨无霸模型。极致智能密度这句 Slogan 算是被它玩明白了。对于开发者而言,这意味着我们可以用更低的硬件门槛,部署一个能写代码、能干活的超级 Agent。这波 Qwen 3.8-27B 如果如期发布,恐怕又要引发一波本地部署和二次开发的热潮了。
发布于 湖北
分享
2
2
未登录
友善发言
image-upload
评论
加载中