吃瓜群众嘻嘻
08-04·杭州朝扬企业管理咨询有限公司员工
国产算力跑大模型,和英伟达差在哪?
用国产GPU跑模型跑到一半显存爆了,厂商说等固件更新国产算力跑大模型,跟英伟达差在哪。我说个体感。上个月公司让我测试一个国产GPU集群跑大模型推理。同一个模型用英伟达A100跑得好好的,换国产的跑,显存占用直接高了30%,跑到一半OOM了。我以为是模型没优化好,调了三天参数还是不行。打电话找厂商技术支持,人家说这个模型架构他们还没适配完,让我等固件更新。等固件更新。我线上业务等着用呢你让我等固件?这就是差距——英伟达的卡插上去就能跑,国产的卡插上去得先查兼容性列表、得看驱动版本对不对、得祈祷你要用的那个模型算子被适配了。参数看着不差,但生态还差一截。我爸昨天问我,说你们公司不是搞科技的吗,怎么天天加班。我说爸我们在测国产芯片。他说国产的好啊,支持国产。我说支持是支持,但踩坑也是真踩坑。就跟相亲一样——介绍人说这个靠谱,你见了发现人确实不差,但生活习惯、三观、作息全得重新磨合。磨合好了也许能过日子,磨合期间你得搭进去无数个通宵。不过话说回来,国产胜在便宜,供应链也不被卡脖子。我们组还在继续试,日常小模型推理没问题,真跑大模型训练还得靠英伟达。希望明年这个时候国产固件不用再让我“等更新”了。
发布于 浙江
2
3
7
未登录
友善发言
image-upload
评论
加载中