我的香菜呢
08-04·项目管理·4年
GPT-5.6 Luna
DeepSeekV4 Flash实测分享
V4 Flash预览版出来的时候,内部评审写的是建议观望便宜但Agent能力拉胯,DeepSWE才7.3分,连基本的代码修复都做不好。七月三十一号正式版上线,看了数据:九项Agent基准全部反超V4-Pro预览版。Terminal Bench从61.8涨到82.7,Cybergym拿了76.7,全栈开发DSBench-FullStack从37干到68.7。Artificial Analysis智能指数50分,只比GPT-5.6 Luna低1分,但价格只有便宜太多架构没动一个参数,纯后训练就把能力拉上来了。后训练的工程能力,可能比预训练堆参数更重要了。
发布于 北京
分享
评论
2
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn