暗物志
08-05·AI领域创作者
国产算力跑大模型,和英伟达差在哪?
国产算力跑大模型:跟英伟达差的那点事儿
最近AI圈最火的话题就是国产算力了。华为昇腾910B、寒武纪思元590、海光DCU这些名字频频出现在科技新闻里。但说实话,很多朋友可能还没搞明白:咱们的国产芯片到底能不能跑大模型?跟英伟达A100、H100又差在哪儿?今天咱就用大白话聊聊这个。先说结论:能跑,但确实有差距,而且差距还不小。英伟达A100的显存带宽达到2TB每秒,H100更是把FP8性能干到了1979 TFLOPS。反观国产选手:昇腾910B的FP16算力大约320 TFLOPS,显存带宽1.2TB每秒,数据上差了大概2到3倍。但这只是账面参数,实际用起来差距更明显。第一个差距在生态。英伟达的CUDA生态已经统治AI圈十多年了,全球90%的AI框架、库、工具都围着CUDA转。就像手机系统一样,安卓生态成熟,换个新系统哪怕硬件再好,用户也得重新学。国产芯片目前主要用自家的CANN、MLU等框架,开发者社区小,遇到bug网上搜不到解决方案,很多功能还得自己手写适配代码,费时费力。第二个差距在互联。训练大模型不是一块卡的事,动辄上千张卡集群作战。英伟达的NVLink和NVSwitch能让几百张卡高速互联,带宽900GB每秒。国产方案目前主要靠PCIe或者自研互联,带宽低、延迟高,做大规模分布式训练时通信就成瓶颈了。打个比方:英伟达像高速公路网,国产更像省道县道,跑大车拉货就慢了。第三个差距在软件成熟度。同样跑Llama 3 70B模型,英伟达卡上跑得顺顺当当,国产卡上可能遇到算子不支持、显存不够、精度对不齐等各种问题。但国产也在追赶:华为MindSpore发展了5年,寒武纪也推出了支持PyTorch的方案,差距在缩小。emoji不过也有好消息。国产芯片最大的优势是:便宜且供应稳定。昇腾910B单卡价格大约8万人民币,A100之前炒到10万还得等货。在当前芯片管制背景下,国产替代成了很多企业的必选项。2024年下半年,国内大模型训练任务已经有30%左右跑在国产芯片上了。再聊聊怎么落地用。中小企业想用大模型,不一定非要自己买卡。可以试试云端API服务,阿里云、腾讯云、华为云都提供国产算力支持的大模型接口,按token付费,一个月几百块就能用上。如果必须本地部署,昇腾Atlas 300I推理卡是个选择,单卡价格2万左右,跑个7B模型问题不大,适合做智能客服、文档问答这种场景。
发布于 内蒙古
1
评论
未登录
友善发言
image-upload
评论
加载中