Shamater
07-03·AI领域创作者
通义千问3的SWRP算法省算力吗?
Qwen3.7
昨天看阿里云百炼更新说Qwen3-235B-A22B支持SWRP(Sparse Weight Routing Pruning,稀疏激活路由剪枝)——推理时按Expert激活分布动态跳过<threshold的低贡献Expert,不重训。我拿vLLM 0.8.x启--enable-swrp --swrp-ratio=0.3跑公司问答Bot,同样输入负载:激活参数从标称22B降到约15.8B(均),A100单卡吞吐从2640 tok/s提至3010 tok/s(+14%),显存峰值略降因为跳过部分Expert weights不上载。输出质量RAG Answer Faithfulness掉不到1%(MMLU-Pro子集盲测没感知差异)。注意要设好calibration set——SWRP用一小撮领域样本统计Expert重要性,我们拿200条客服QA做校准,乱设ratio可能切掉关键Expert导致专业域掉点。适合高并发内部服务降本,不推荐跑未校准通用聊天随意开。SWRP对固定域高频推理值得开,省卡降费不损质量——前提花半小时做领域校准,别无脑copy启动参数。
发布于 江西
分享
评论
2
未登录
友善发言
image-upload
评论
加载中