小白学AI
08-06·AIGC算法·5年+
V4-Flash为何能小参数反超大模型?
很多人疑惑 V4-Flash 总参 2840 亿,单次仅激活 13B 参数,却能对标稠密万亿模型。核心创新是MoE 混合专家 + 双稀疏注意力双重压缩架构。 传统稠密模型每轮推理全部参数参与计算,算力开销随规模线性暴涨;V4-Flash 内置 64 组细分专家,门控网络动态筛选 Token 匹配的 2 个专家执行计算,其余专家休眠,推理算力仅为同规格稠密模型 10%。同时搭配 CSA/HCA 交错稀疏注意力,百万上下文下 KV 缓存占用压缩至前代 7%,长文本成本断崖式下降。 实测同等硬件 4G 显存即可部署运行,长文档批量任务速度领先稠密 70B 模型。短板是极限数理推理存在小幅差距,适合批量自动化场景,科研高精任务仍需 Pro 版本兜底,稀疏架构是国产模型成本革命核心突破口。
发布于 上海
1
2
2
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn