柚子知AI遇
08-06·AI领域创作者
国产算力跑大模型,和英伟达差在哪?
国产算力跑大模型,差在哪了
高盛7月研报数据很扎眼:英伟达在华份额从95%暴跌到8%,华为昇腾Q1拿下52.3%国内市场,昇腾950PR单卡FP4算力是H20的2.87倍,采购价却只有H200的三分之一。国产算力真追上来了?说实话差距还在,但在快速收窄。昇腾950超节点跟B300的性能差距从910C时代的1/8缩到1/4,但单位算力成本仍是B300的3倍。机器学习在国产芯片上的适配成本高,DeepSeek V4做了8款国产GPU的Day0原生适配才算彻底脱离CUDA。深度学习训练框架从PyTorch迁移到CANN/MindSpore,改的不是几行代码是整个工具链。推理优化在昇腾上做算子融合、精度对齐,坑比英伟达多十倍。但趋势明确——长鑫DRAM上市破万亿,存储自主可控补上"内存墙"短板,DeepSeek等国产模型智能水平追到全球可用,推理调用量攀升倒推国产算力需求增长。算法竞赛已经从"谁有最强GPU"演变为"谁能稳定交付完整算力栈",国产替代进入深水区。高盛7月研报数据很扎眼:英伟达在华份额从95%暴跌到8%,华为昇腾Q1拿下52.3%国内市场,昇腾950PR单卡FP4算力是H20的2.87倍,采购价却只有H200的三分之一。国产算力真追上来了?说实话差距还在,但在快速收窄。昇腾950超节点跟B300的性能差距从910C时代的1/8缩到1/4,但单位算力成本仍是B300的3倍。机器学习在国产芯片上的适配成本高,DeepSeek V4做了8款国产GPU的Day0原生适配才算彻底脱离CUDA。深度学习训练框架从PyTorch迁移到CANN/MindSpore,改的不是几行代码是整个工具链。推理优化在昇腾上做算子融合、精度对齐,坑比英伟达多十倍。但趋势明确——长鑫DRAM上市破万亿,存储自主可控补上"内存墙"短板,DeepSeek等国产模型智能水平追到全球可用,推理调用量攀升倒推国产算力需求增长。算法竞赛已经从"谁有最强GPU"演变为"谁能稳定交付完整算力栈",国产替代进入深水区。
发布于 上海
分享
评论
1
未登录
友善发言
image-upload
评论
加载中