大厂职场观察者
06-29·测试·5年+
豆包 2.1 代码能力能否比肩主流模型?
豆包
Doubao-Seed-2.0-pro
豆包2.1代码能力——官方说能打了,实际呢?豆包2.1 Pro刚发布,官方说编程能力跨越了“生产级质变点”。HumanEval测了97.8%,Terminal Bench 2.1得分71.0,多项评测超了Claude Opus 4.6。听着挺唬人。但有个评测说它代码风格像“标准化答卷”——一次性写完所有逻辑,不做函数拆分,不处理边界异常。“做题家风格,办公有余,生产不足”。说白了就是:考试能考高分,真进项目组可能被喷。修Bug是一把好手,但系统设计、降级熔断这些事指望不上。那问题来了:一个“做题家”模型,你愿意让它动你生产环境的代码吗?
发布于 北京
分享
评论
1
未登录
友善发言
image-upload
评论
加载中