雪咤
06-29·全栈工程师·5年+
豆包 2.1 代码能力能否比肩主流模型?
豆包
GPT-5.5
Claude Opus 4.8
SciCode59.8分豆包科学代码最强
SciCode科学计算代码评测覆盖数学物理化学生物地学五大学科,豆包2.1 Pro以59.8分领先GPT-5.5的58.4和Claude Opus 4.7的56.4。这个成绩让很多人意外因为大家印象里豆包偏C端不够硬核,但科学代码这块它确实做到了第一。我拿它跑了一个流体力学仿真脚本生成任务,公式推导和数值方法选择都对了比我预期好太多。但NL2Repo-Bench测试豆包47.0分超过GPT-5.5的45.1却远低于Claude Opus 4.7的58.2,说明代码库级别的大型项目理解Claude还是天花板。SWE-Pro软件工程长任务评测豆包57.5分低于Claude的64.3差距明显。所以结论是单文件和科学计算豆包已经追平甚至超越国际顶流,但复杂软件工程项目Claude还是稳一个身位别被一个分数唬了要看具体场景。选模型这件事别看一个分数就下结论多跑几个真实业务场景的对比测试比看任何跑分都靠谱。
发布于 广东
分享
评论
1
未登录
友善发言
image-upload
评论
加载中