雪咤
07-03·全栈工程师·5年+
施密特:中国开源我们控不住
昇腾用软件追平硬件差距
作为做芯片软件优化的,施密特特意提到华为昇腾这点我太有感触了,他说"中国人用较弱的硬件通过各种软件方法做出了顶级模型",这不是夸奖是真的怕了。大家可能不知道,芯片性能不是只看硬件参数的,软件栈优化得好,同样硬件能跑出高30%-50%的性能,这不是夸张是我们日常工作。英伟达为什么强?不是硬件比别人强一倍,是CUDA生态太好了,软件优化做到极致了,同样的算子别人跑10ms它跑5ms,这就是差距。之前我们国产芯片硬件参数看着不差,但一跑实际大模型就拉胯,就是软件栈不行,算子没优化好,通信延迟高,框架适配差。但这两年进步真的快,我身边做昇腾适配的团队,同样的7B模型推理性能已经追到A100的80%左右了,训练性能也到了70%,靠的是什么?就是施密特说的"各种软件方法":算子融合、通信优化、混合精度、显存复用、编译优化,一堆工程师死磕每一个算子每一层网络,一点点把性能抠上来。他说的"绕过延迟和架构问题"是真的,硬件架构不一样我们就在软件层做转换,算子不支持我们就拆成多个算子组合实现,通信慢我们就做异步流水并行,硬的不行来软的,硬生生把差距追上来了。这就是人的主观能动性,你卡我硬件我就在软件上找补回来,中国人最擅长这个。不过也要承认差距,CUDA生态二三十年的积累不是一朝一夕能追上的,最高端的训练场景差距还很大,但至少看到希望了。有没有在做国产芯片适配的脉友?你们现在性能追到什么程度了?
发布于 广东
分享
2
1
未登录
友善发言
image-upload
评论
加载中