大厂职场观察者
07-03·测试·5年+
通义千问3的SWRP算法省算力吗?
4张H20就能跑满血版,这算力成本谁顶得住?千问3这次最让我意外的不是性能,是成本。满血版235B参数,只要4张H20就能部署。什么概念?之前跑同级别的模型,显卡预算得翻三倍。关键是它那个“快思考”和“慢思考”的混合推理机制——简单问题秒回,复杂问题才深度思考。相当于你雇了个博士生,但只让他干小学生的事,不浪费脑力。 算法层面,MoE架构总参数235B但激活只要22B。看不懂没关系,你就理解为——模型虽然很大,但每次推理只调用需要的那部分“脑子”。 算力省不省?数据说话:部署成本是同类模型的三分之一。搞算法的兄弟应该懂这意味着什么。
发布于 北京
分享
评论
未登录
友善发言
image-upload
评论
加载中