微学AI
08-17·AI领域创作者
千问20亿下载凭什么第一
30亿参数激活,跑出270亿的水平
上周拿 Qwen3.6-35B-A3B 做了个实验。标称35B总参数,实际推理时只激活3B,跑一个仓库级的代码重构任务。结果让我有点意外,上下文窗口飙到262K,整个项目扔进去没丢一句逻辑,比之前用某个270B稠密模型的结果还干净。这就是 MoE 架构的狠处。不是堆参数,是让参数"聪明地偷懒"。该激活的激活,不该动的趴着不动。推理成本下来了,开发者买一块24G显存的卡就能跑。更让我感慨的是,Qwen 不是靠一个模型打天下。460多个开源模型,从文本到多模态,从0.5B到2.4T,所有档位都有。你想微调一个中文法律问答模型,有现成的底座;你想在手机上跑一个轻量模型,有1.8B的版本;你想搞大规模私有部署,Qwen3.8-Max 的权重直接放出来。我做了三年模型选型,没见过哪个开源家族把覆盖面铺到这种程度。Hugging Face 报告说 Qwen 已经成了"开发者默认工作流的一部分",这句话不是吹的,是用脚投票投出来的。评论区聊聊,你现在主力用哪个开源模型做本地部署?
发布于 福建
1
1
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn