柚子知AI遇
08-06·AI领域创作者
V4-Flash为何能小参数反超大模型?
V4-Flash为何能小参数反超大模型?
7月31日DeepSeek V4 Flash正式版上线,最反常识的事发生了:架构没变、参数没变、上下文窗口没变,只重做了后训练,DeepSWE得分从7.3飙到54.4,暴涨7倍,全面反超自家旗舰V4-Pro预览版。我拆了一下技术逻辑。2840亿总参数,每次只激活130亿,MoE稀疏激活比例4.6%。等于拥有284B的知识储备,却只花13B的推理成本。但这次真正牛的不是架构,是后训练——强化学习策略优化、工具调用数据工程、对齐方法全面迭代,机器学习模型在Agent场景下的表现跟训练数据质量强相关,而不是参数规模。我自己实测过,让它跑一个多步骤的部署任务:读环境变量→装依赖→改配置→跑测试→生成报告,全程自动,工具调用从15个裁到2个反而更准。深度学习在任务拆解上的进步肉眼可见。某三甲医院部署后,门诊分诊准确率92.3%,响应延迟从2.4秒压到380毫秒。
发布于 上海
分享
评论
1
未登录
友善发言
image-upload
评论
加载中