王西蒙AI创客
08-06·AI领域创作者
V4-Flash为何能小参数反超大模型?
V4-Flash为什么能小参数反超大模型?核心就三个字:MoE架构。2840亿总参数,每次推理只激活130亿。大部分参数在睡觉,干活的只有一小部分。但这一小部分经过精心训练,干出来的活不比那些全量激活的大模型差。更关键的是后训练。V4-Flash通过重新后训练,Agent能力实现跨越式提升。Terminal Bench 2.1得分从61.8跃升至82.7。同样的基础架构,换一套训练方法,效果翻倍。这说明模型规模不是决定因素。训练方法和数据质量的权重正在上升。堆参数堆不出好模型,好模型是训出来的,不是堆出来的。
发布于 四川
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn