碧霄洞主
08-03·销售·10年+
国产算力跑大模型,和英伟达差在哪?
单卡只有1/3性能,国产集群干翻英伟达
据SemiAnalysis测算,单颗国产AI芯片的性能大约只有英伟达Blackwell架构的三分之一。拿具体的卡对比:昇腾910C的FP16算力(800 TFLOPS)是H100(1,979 TFLOPS)的40%,显存带宽(1.8 TB/s)落后H100的46%。这就是物理天花板——先进制程被卡,单点硬刚确实打不过。那国产算力怎么突围?不拼单卡,拼集群。华为在WAIC上展出了Atlas 950超节点真机,单机柜64张卡,靠自研“灵衢”协议把1024张卡连在一起,实现256TB全局统一内存编址,通信时延压到3微秒。什么概念?昇腾上一代超节点已在20多个行业落地750多套。中银证券报告显示,与英伟达NVL144系统相比,昇腾950超节点总算力达到其6.7倍。但是注意——“总算力”和“单卡性能”是两码事。梁文锋在投资人会议上的原话是:国内最大模型激活参数大概几十B,跟美国800B差一个数量级。他判断整体落后美国12到18个月。但同时也说,华为950超节点在性能和价格上可以平替英伟达GB200、GB300。一个标志性的事件: 美团发布LongCat-2.0,1.6万亿参数,从训练到推理全部由国产算力集群完成,是“英伟达含量为0”的万亿级别大模型。作为业务运营,我的实操感受是:日常推理(翻译、生成报告、做图),国产算力完全够用。我让团队用昇腾跑Qwen做批量翻译,速度跟英伟达没明显差别,成本低一大截。但涉及复杂训练和调优,目前还是得切回英伟达——国产算力的软件生态还在补课阶段。有研究指出,昇腾910B在微调场景下存在算子适配和数值精度问题。一句话: 日常干活用国产,不亏;搞研发攻坚,还得备着英伟达。
发布于 广东
1
评论
未登录
友善发言
image-upload
评论
加载中