王西蒙AI创客
08-06·AI领域创作者
V4-Flash为何能小参数反超大模型?
DeepSeek V4-Flash用284B总参数、13B激活参数,性能逼近Opus 4.8。GLM-5.2总参数7440亿。参数差了26倍,性能却没差多少。原因很简单:参数不是越大越好。V4-Flash采用MoE架构,每次推理只激活13B参数。就像一个庞大专业团队,处理具体任务时只调动最合适的一部分专家。知识储备足够,干活的时候精兵简政。更重要的是训练方法。V4-Flash经过精细化强化学习和高质量数据重训。在代码修复基准DeepSWE上,得分从7.3暴涨到54.4。同样的架构,换一套训练方法,能力天差地别。小参数反超大模型的秘密就两条:MoE架构加高质量训练。堆参数的时代过去了。拼训练方法和数据质量的时代来了。
发布于 四川
分享
评论
1
未登录
友善发言
image-upload
评论
加载中