靠谱阿无
08-04·AI领域创作者
华为把5000亿参数大模型,免费开源了
5050亿参数,完全不用英伟达芯片训出来的大模型,权重、代码、技术报告,一次性全扔到网上随便下载。这事发生在7月31日。华为开源了openPangu-2.0-Pro——总参数5050亿,每次推理只激活约1800亿,能吃下512K的超长文本。什么概念?一整套合同、一座工厂一年的日志、一本书,一口气全塞进去,它还能实时给你吐结果。更反直觉的地方在这:余承东在开发者大会刚喊完"把盘古做到世界第一",转头就把最核心的东西免费公开了。不是只扔个权重文件糊弄事。很多开源模型给你个权重,推理还得靠别人的框架、别人的芯片。华为这次连预训练代码、后训练代码、训练算子七大组件一起交出来,从昇腾NPU训练到原生推理,整条链路可以完整复现。等于说,用国产芯片训500B+级别模型这条路,华为已经趟平了,后来者照着走就行。算力被卡脖子,反而逼出了新活法。架构上做了不少"螺蛳壳里做道场"的优化:混合注意力分层、四支流拓扑、自投机解码……结果是在128K上下文下,单卡吞吐跑到1326 token/s,最低延迟9.55毫秒。这意味着它能在边缘设备上实时跑——不是实验室里的玩具,是能装进工厂车间、车载系统里干活的那种。真正有意思的是它能干什么。跟ChatGPT那种"什么都聊两句"的通才有本质区别,盘古从第一天起就是奔着"行业专家"去的。石油勘探的亚毫米缺陷识别、国家电网的百种巡检适配、药企的药物发现周期从一两年压到三个月——这些不是Demo演示,是已经在产线上跑着的案例。智能驾驶那边,512K的长窗口正好能吃下完整的长驾驶轨迹,做连续决策。为什么敢这么大方?任正非二十年前写过一句话:苹果公司最大的特点是开放合作,"苹果树上结出了西瓜"。华为自己只做最有优势的部分,把其余的交给伙伴。这次开源的逻辑一模一样——先把开发者和企业聚到"昇腾+盘古"这条河里,用的人多了,工具链完善了,应用丰富了,河就宽了。生态赢了,单机性能输赢反而是次要的。对中小机构、地方医院、县城农研所来说,这套全栈自主的东西意味着终于不用把数据送到国外云端,也不用花天价买算力——下载下来就能改、就能用。对全球南方国家而言,这是一套不受地缘限制的选项。把最核心的东西交出去,不是示弱,是最高级的自信。
发布于 安徽
4
4
1
未登录
友善发言
image-upload
评论
加载中