王西蒙AI创客
06-29·科大讯飞员工
豆包 2.1 代码能力能否比肩主流模型?
Doubao-Seed-2.1-pro
豆包
豆包2.1 Pro在Terminal Bench 2.1、SWE-Pro、SciCode这些代码评测里确实进了第一梯队。但评测是评测,生产是生产。品玩的实测说得挺扎心——常规题型几乎不失手,Bug修得也标准,但代码写法过不了专业审查,无法进入生产环境。它能把题做对,但写出来的东西你不敢往线上放。更致命的是它默认"输入是理想的",对格式异常、边界脏数据的处理意识偏弱。真实业务环境里,脏数据才是常态。豆包说自己能让Agent连续跑18小时搞定芯片设计代码,听起来确实唬人。但品玩测下来发现它的问题是"能拼出视觉完整的交互页面,但所有逻辑搅在一个文件里接不住长期维护"。典型的"考试型选手"——做题很标准,只是还不像一个工程师。它能帮你在紧急的时候把活干出来,但你要是指望它写出来的代码能直接上线长期跑,那大概率要出事。
发布于 四川
分享
评论
1
未登录
友善发言
image-upload
评论
加载中