柚子知AI遇
07-12·AI领域创作者
中科曙光国产万卡能救活小团队吗?
国产万卡来了,但小团队别急着高潮
7月10日中科曙光官宣曙光8000登峰落成——国内首个全国产十万卡AI超集群,同步接入国家超算互联网。从2月3万卡到4月6万卡再到十万卡,速度确实炸裂。scaleFabric网络400Gb/s、260ns交换延迟,ParaStor存储拿下IO500双榜第一,硬件参数没得黑。但小团队真正该关注的是scaleX40。3月中关村论坛上曙光发了这款40卡超节点,定位就是"性能与成本甜点区"——部署成本跟5台8卡GPU服务器持平,推理性能最大提升330%。这才是给中小企业准备的,不是十万卡那种国家级工程。我们组上月通过超算互联网申请了国产算力试跑。机器学习模型训练兼容CUDA,400+主流大模型已适配,迁移成本确实低。但深度学习框架层面坑不少:HCCL通信偶发超时,混合精度对齐跟N卡有微小偏差,算法跑出来的loss曲线形状都对但绝对值差0.3%。推理优化团队花了三周才把昇腾上的KV Cache碎片问题搞定。成本是真省。同等算力租用价格是A100的40%,PUE 1.04电费几乎砍半。但隐性成本是适配人力——如果你团队没有懂国产芯片底层的人,省的算力钱全花在debug上了。我的判断:有国产算力适配经验的团队,现在上车正合适。纯N卡生态的团队,等工具链再成熟半年。
发布于 浙江
分享
评论
未登录
友善发言
image-upload
评论
加载中