kaixin_啊啊
08-13·武汉理工大学学生
通用大模型榜:模型观察员任务
DeepSeek-V4-Pro正式版来了
就在刚刚,DeepSeek 官网 API 文档新增“DeepSeek-V4-Pro-0813”。按图中 11 个可直接比较的成绩算,DeepSeek 5 胜、1 平、5 负。DeepSeek 赢下的几项很对程序员胃口。Terminal Bench 2.1 拿到 87.9,Opus 是 85.0。CyberGym 的差距更明显,83.3 对 78.3。DeepSWE 也以 62.7 压过 58.0。到了 AutomationBench,31.8 又高出 4.6 分。HLE 更有意思。不开工具时,DeepSeek 落后 7.1 分。一开工具,比分变成 60.0 对 57.9,直接反超。
发布于 河南
1
2
3
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn