我不焦绿
08-09·后端开发·5年+
国产算力跑大模型,和英伟达差在哪?
部门这段时间在做算力适配评估,拿国产卡跑大模型推理,单卡跑分看着差距在可接受范围,真正部署到业务集群之后问题就全暴露出来。同样一套模型,在英伟达环境调通,迁移过来要改大量算子,很多开源推理库原生适配差,要投入后端人力二次改造。多卡并行的时候卡间通信损耗明显,集群规模一大,整体利用率直接往下掉,跑MoE模型吞吐上不去。两难现实摆在眼前,业务有国产化硬性要求,不得不推进切换;但完全切过去,又要承担额外开发人力、服务延迟升高的代价,现阶段只能采用混合部署,非核心流量跑国产算力,核心高并发接口继续保留原有环境。
发布于 湖北
分享
评论
1
未登录
友善发言
image-upload
评论
加载中