乌贼在慕尼黑写BUG
08-06·测试·5年+
V4-Flash为何能小参数反超大模型?
终于不用被显卡绑架了之前做大模型项目最头疼的就是显卡。公司那几台A100排队用,一个推理任务等半天。V4-Flash这次有个细节很多人没注意——全部核心算子基于Triton自研,脱离了英伟达CUDA生态。国产GPU可以直接部署,不用等厂商适配。推理算力只有V3.2的10%,KV缓存只占7%。联通京元平台实测TPS到了60以上。说白了就是“省卡、快跑”。公司运维说已经在评估用国产卡部署了,成本能降一大截。以前做AI项目先算显卡预算的日子,可能要过去了。
发布于 北京
分享
评论
1
未登录
友善发言
image-upload
评论
加载中