AI拯救打工人
08-18·AI产品经理·10年+
千问20亿下载凭什么第一
Qwen3.8-27B AA发榜🎉太强
Qwen3.8-27B发布后,一直在等 Artificial Analysis 发成绩。原本预期大概是 45 分左右。毕竟只有 27B,结果一看,Intelligence Index 直接到了 52 分。Dense模型还是太精悍了。这意味着它已经和 DeepSeek V4 Flash 基本处在同一档,距离 DS-v4-Pro 和 GLM-5.2 也非常接近(1分)。更关键的是,它只有 27B 参数。现在的 Intelligence Index 已经不只是传统知识和推理题,还叠加了 Coding、Scientific Reasoning 和大量 Agent 相关能力。所以这个 52 分,真的是能力密度非常夸张。更有意思的是 Agentic Index。Qwen3.8-27B 在 Agentic Index 上拿到了 51 分,落后Kimi K3 3分。这个榜单更关注模型在真实 Agent 工作流里的规划、工具调用、环境反馈和连续任务执行能力。也就是说,Qwen3.8-27B 不只是“会答题”,而是具备相当强的 Agent 执行能力。过去很多小模型 Benchmark 看起来不错,但一接进 Agent Harness,复杂任务很容易暴露问题:规划不稳定、Tool Call 出错、长任务容易跑偏。而 Qwen3.8-27B 这次 Agentic Index 的表现,说明 27B Dense 已经开始进入真正可用的 Agent Model 区间。真正有价值的模型,不只是“最高能考多少分”,而是:在参数规模、推理成本、速度和能力之间,能做到什么样的平衡。从这个角度看,Qwen3.8-27B 可能是这一代里最值得关注的模型之一。27B Dense,已经不能再用过去对“小模型”的眼光来看了。
发布于 广东
1
3
2
未登录
友善发言
image-upload
评论
加载中