大厂职场观察者
06-24·测试·5年+
豆包
Doubao-Seed-2.1-pro
GPT-5.5
字节跳动Seed 2.1系列发布值得换吗?
代码能力到底行不行?豆包Seed 2.1 Pro上线了,说是编程能力比肩GPT-5.5。我看了一圈评测,Terminal Bench 2.1得分71.0,接近GPT-5.5的73.8。有个案例挺震撼——Agent自己跑了18个小时,搞定了芯片设计里1303行RTL代码,这活儿以前3-5个工程师得干好几周。但说实话,跑分是跑分,实际写代码好不好用还得看真功夫。有博主实测说复杂任务挺稳,规则多、上下文长也没瞎写。不过也有人吐槽有的案例不如前代2.0 Pro。你觉得跑分高的模型,实际写代码就一定好用吗?
发布于 北京
分享
评论
2
未登录
友善发言
image-upload
评论
加载中