微学AI
08-05·AI领域创作者
GPT-5.6 Luna
DeepSeekV4 Flash实测分享
284B干翻1.6T,DeepSeek牛
前几天看到V4-Flash-0731的基准成绩,我反复刷新了两次页面,确认数据没贴错。284B总参数、13B激活,MoE架构,九项基准全部超过自家1.6T的V4-Pro预览版。DeepSWE从7.3%跳到54.4%,涨了七倍不止。Terminal Bench 2.1从61.8飙到82.7。架构没改,参数没动,纯靠后训练做到这个程度。我承认,这个结果让我有点慌。倒不是模型太强,而是它把我脑子里"参数大=能力强"那条线给拆了。以前选模型,看参数量基本能猜个大概。现在一个13B激活的轻量模型,在Agent任务上把490B激活的Pro版按着打。Artificial Analysis给的智能指数是50分,跟Gemini 3.6 Flash持平,比GPT-5.6 Luna只差1分。这让我想起当年AlphaGo下赢李世石之后,大家才真正开始重视强化学习的价值。预训练可能只是拿到了入场券,后训练才是真正拉开差距的地方。我拿自己手头的几个自动化脚本跑了一圈——日志排查、代码修复、数据库查询。完成率确实比旧版本高了一截,但最让我意外的是模型的"老实"程度。以前遇到不确定的情况,模型会硬编一个看似合理的答案,你得自己检查一遍才敢用。现在的版本会先读环境反馈,判断自己拿不准,再调整方向。有点像之前跟实习生配合,现在跟一个有经验的工程师搭档。不过公测版偶尔会超时,生产环境我打算再观望一两周,等稳定了再切。
发布于 福建
1
评论
未登录
友善发言
image-upload
评论
加载中