满眼星河12138
08-06·快手员工
V4-Flash为何能小参数反超大模型?
V4-Flash为何能小参数反超大模型?
DeepSeek V4-Flash用284B总参数、13B激活参数,硬刚自家1.6万亿的Pro版。小参数反超大参数,这事放在两年前没人信。怎么做到的?没改架构,只重新做了一次后训练。用更高质量的数据和更精细的强化学习,把模型调教得更聪明。这就像同一台电脑,装了个更好的操作系统,跑得更快了。效果有多猛?代码修复基准DeepSWE从7.3暴涨到54.4,涨了640%。Terminal Bench得分从61.8跳到82.7。这哪是优化,这是换了个脑子。更狠的是它脱离了英伟达生态。全部核心算子基于Triton自研,国产GPU直接部署。不再被卡脖子了。V4-Flash证明了AI竞争正在从拼参数转向拼效率。谁能在更少的算力下做出更好的效果,谁才是最后的赢家。
发布于 中国香港
分享
评论
1
未登录
友善发言
image-upload
评论
加载中