泰山弟子_dmnY
08-06·AI领域创作者
V4-Flash为何能小参数反超大模型?
关键是MoE只激活13B+压缩注意力(CSA/HCA),1M上下文下单token算力只剩V3.2的10%、KV cache 7%,再加FP4量化专家和on-policy蒸馏把专项专家能力压回统一模型,小激活也能接住大部分通用 benchmark。 不是参数魔法,是架构和训练法一起省出来的。
发布于 广东
分享
评论
未登录
友善发言
image-upload
评论
加载中