Shamater
07-03·AI领域创作者
通义千问3的SWRP算法省算力吗?
Qwen3.7
昨天看阿里云百炼更新说Qwen3-235B-A22B支持SWRP(Sparse Weight Routing Pruning,稀疏激活路由剪枝)——推理时按Expert激活分布动态跳过<threshold的低贡献Expert,不重训。我拿vLLM 0.8.x启--enable-swrp --swrp-ratio=0.3跑公司问答Bot,同样输入负载:激活参数从标称22B降到约15.8B(均),A100单卡吞吐从2640 tok/s提至3010 tok/s(+14%),显存峰值略降因为跳过部分Expert weights不上载。输出质量RAG Answer Faithfulness掉不到1%(MMLU-Pro子集盲测没感知差异)。注意要设好calibration set——SWRP用一小撮领域样本统计Expert重要性,我们拿200条客服QA做校准,乱设ratio可能切掉关键Expert导致专业域掉点。适合高并发内部服务降本,不推荐跑未校准通用聊天随意开。SWRP对固定域高频推理值得开,省卡降费不损质量——前提花半小时做领域校准,别无脑copy启动参数。
发布于 江西
分享
评论
2
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn