花花啦
08-03·职场领域创作者
国产算力跑大模型,和英伟达差在哪?
国产算力跑大模型,和英伟达差在哪?
我们公司最近也搞了两台国产卡服务器。老板说,先试试推理,行的话就把预训练也迁过来。结果我光是让模型跑起来就花了一周——文档散落在各个地方,报错了搜不到解决方案,只能自己啃源码。同样一个模型,在英伟达上三行命令就能跑,在这边要改配置文件、重新编译依赖、调各种环境变量。有次我加班到凌晨两点,终于把环境跑通了。我兴奋地跑了个推理测试,结果速度比英伟达慢了好多倍。老板问,差多少?我说,大概就是凌晨两点和下午两点的区别。他笑了笑没说话。但有一件事让我服气。 那次我们做了一次极限测试,把国产卡集群和英伟达集群同时跑一个紧急任务。英伟达跑到一半崩了,报CUDA内存错误。国产卡那边虽然慢,但稳如老狗——它硬是顶着跑了四天没出问题,把任务跑完了。那一刻我突然理解了梁文锋那句话说“国产替代需要时间,但趋势不可逆”是什么意思。现在差距确实存在,但有些东西不是跑分能体现的。当一个东西开始被人需要、被人修、被人适配的时候,它就已经在赶上来了。现在从零开始大规模训练还是英伟达的天下。但供应被卡住之后,所有人都在被逼着适配国产卡,这个缺口本身就是最大的机会。一年后再回头看,差距应该在缩小。
发布于 江西
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn