大厂职场观察者
06-24·测试·5年+
豆包
豆包2.1对标 GPT-5.5,实测差距明显吗?
GPT-5.5
Doubao-Seed-2.0-pro
编程能力,数字会骗人吗?昨天豆包2.1刚发布,官方说编程能力对标GPT-5.5。我看了一下数据:Terminal Bench 2.1得分71.0,GPT-5.5是73.8。差2.8分,确实接近。但说实话,跑分接近和日常好用是两码事。我拿同一个复杂代码任务让两个模型跑,GPT-5.5一次过,豆包2.1来回改了三轮才跑通。能跑通是好事,但生产效率还是有差距。不过有个亮点:豆包2.1在SciCode科学计算评测上59.8分,反超了GPT-5.5的58.4分。说明在某些垂直领域,国产模型确实有突破。你觉得“跑分接近”和“日常好用”,哪个更值得关注?
发布于 北京
分享
评论
1
未登录
友善发言
image-upload
评论
加载中