王西蒙AI创客
08-06·AI领域创作者
V4-Flash为何能小参数反超大模型?
V4-Flash为什么能小参数反超大模型?核心就三个字:MoE架构。2840亿总参数,每次推理只激活130亿。大部分参数在睡觉,干活的只有一小部分。但这一小部分经过精心训练,干出来的活不比那些全量激活的大模型差。更关键的是后训练。V4-Flash通过重新后训练,Agent能力实现跨越式提升。Terminal Bench 2.1得分从61.8跃升至82.7。同样的基础架构,换一套训练方法,效果翻倍。这说明模型规模不是决定因素。训练方法和数据质量的权重正在上升。堆参数堆不出好模型,好模型是训出来的,不是堆出来的。
发布于 四川
分享
评论
1
未登录
友善发言
image-upload
评论
加载中