乌贼在慕尼黑写BUG
08-06·测试·5年+
V4-Flash为何能小参数反超大模型?
终于不用被显卡绑架了之前做大模型项目最头疼的就是显卡。公司那几台A100排队用,一个推理任务等半天。V4-Flash这次有个细节很多人没注意——全部核心算子基于Triton自研,脱离了英伟达CUDA生态。国产GPU可以直接部署,不用等厂商适配。推理算力只有V3.2的10%,KV缓存只占7%。联通京元平台实测TPS到了60以上。说白了就是“省卡、快跑”。公司运维说已经在评估用国产卡部署了,成本能降一大截。以前做AI项目先算显卡预算的日子,可能要过去了。
发布于 北京
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn