方小瑜
08-06·测试·5年+
国产算力跑大模型,和英伟达差在哪?
国产算力离英伟达差多远
先说结论:单卡差一倍 系统战追上了 生态差一个时代 但窗口期正在收窄单卡性能 物理差距确实存在据测算 单颗国产AI芯片性能大约是英伟达Blackwell架构的三分之一 业界公开的数据更具体 四张华为卡约等于一张英伟达卡昇腾910C的FP16算力800 TFLOPS 仅为H100的百分之四十 显存带宽1.8 TB/s落后H100的3.35 TB/s达四成六 在端到端大模型训练和推理中 910C实际性能约为H100的六到八成 芯片迭代节奏上 国产落后约两年这个差距的根源是制程受限 国产高端AI芯片主要依赖7nm级工艺 而英伟达可通过台积电使用更先进制程与封装技术单卡不够 系统来凑既然单卡追不上 国产厂商换了个打法 把几百上千颗芯片连成超节点 用规模换性能华为昇腾950超节点把1024张卡连在一起 通信时延压到3微秒 有报告显示 昇腾950超节点总算力达到英伟达同级别NVL144系统的6.7倍 某AI创始人的评价是 华为950超节点在任务层面可以完全平替英伟达GB200 GB300 延迟一致中科曙光已落地国内首个全国产十万卡AI超集群 阿里云也把2.4万亿参数大模型跑在了国产超节点上生态才是真正的护城河 但正在松动英伟达真正的壁垒不是GPU 是CUDA CUDA经过15年积累 拥有超过1万个算子 而华为CANN的算子覆盖度约2000个 仅为CUDA的两成 迁移一个中等规模训练项目 估算需要6到18个月和50万到200万的额外工程投入但生态壁垒正在被AI本身瓦解 某AI创始人的判断是 用AI写代码 可以把跟英伟达一模一样的生态构建出来 他预测未来一年内 国产芯片生态用不起来不好用的认知就能被扭转阿里平头哥已开源SAIL全栈软件 直接对标CUDA 华为昇腾CANN也在全面开源开放产能才是当前最大的瓶颈国产AI芯片的硬件和生态都没有问题 唯一有问题的是产能不够训练一个8000亿参数的大模型 约需5万张英伟达GB300 或20万张华为昇腾950卡 这个数量级远超当前国产芯片的供给能力市场格局正在逆转2026年Q1 国产AI加速芯片市占率首次突破五成二 英伟达在华份额从三年前的九成五骤降至百分之八 机构预测英伟达中国市场份额可能从2025年的约四成降至2026年的约百分之八
发布于 四川
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn