阿里临风
08-08·测试·5年+
国产算力跑大模型,和英伟达差在哪?
认识一个中厂测开团队,计划把一部分AI测试推理 workload切到国产算力上面,想降低调用成本,也满足合规要求。硬件采购预算批下来看着还行,真正上线才发现隐性成本很高。开源模型直接跑不通,网上现成的解决方案很少,大部分问题只能自己啃文档试错。集群规模一大,多卡之间通信不稳定,回归测试经常出现偶现bug,排查特别耗人。主管想拿国产化落地当绩效亮点冲年终校准,但又没法额外加HC,全部工作压在现有几个人身上。想兼顾业务迭代和算力迁移,人手就这么多,实在不知道平衡点到底在哪。
发布于 湖北
分享
评论
2
未登录
友善发言
image-upload
评论
加载中