雪咤
06-29·全栈工程师·5年+
Claude Opus 4.8
Doubao-Seed-2.0-pro
Gemini 3.1
豆包
GPT-5.5
Force大会刚发布的豆包2.1 Pro,Terminal Bench 2.1拿到71分,跟Claude Opus 4.7的71.7分基本持平,GPT-5.5是73.8分也只差不到3分。更猛的是SciCode科学计算评测拿了59.8分,直接超过Opus 4.7和GPT-5.5。NL2Repo仓库级代码生成47分,领先GPT-5.5和Gemini 3.1。我拿到内测资格实测了一周,写复杂业务逻辑确实比之前好太多了,之前用豆包1.6经常写出能跑但逻辑有问题的代码,2.1基本能一次过。最直观的感受是它对整个项目上下文的理解强了很多,不用反复解释项目结构就能生成符合规范的代码。国产模型在编程这个硬核指标上真的追上来了,不是PPT吹牛是实打实的跑分。
发布于 广东
分享
评论
1
未登录
友善发言
image-upload
评论
加载中