满眼星河12138
08-06·快手员工
V4-Flash为何能小参数反超大模型?
V4-Flash为何能小参数反超大模型?
DeepSeek V4-Flash用284B总参数、13B激活参数,硬刚自家1.6万亿的Pro版。小参数反超大参数,这事放在两年前没人信。怎么做到的?没改架构,只重新做了一次后训练。用更高质量的数据和更精细的强化学习,把模型调教得更聪明。这就像同一台电脑,装了个更好的操作系统,跑得更快了。效果有多猛?代码修复基准DeepSWE从7.3暴涨到54.4,涨了640%。Terminal Bench得分从61.8跳到82.7。这哪是优化,这是换了个脑子。更狠的是它脱离了英伟达生态。全部核心算子基于Triton自研,国产GPU直接部署。不再被卡脖子了。V4-Flash证明了AI竞争正在从拼参数转向拼效率。谁能在更少的算力下做出更好的效果,谁才是最后的赢家。
发布于 中国香港
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn