乌贼在慕尼黑写BUG
06-29·测试·5年+
豆包 2.1 代码能力能否比肩主流模型?
豆包
豆包2.1到底算不算“能用”?两种声音吵翻了对豆包2.1的代码能力,现在有两种截然不同的声音。一方说“跨越了生产级质变点”,SWE-bench超了Claude Opus 4.6,能独立完成工程任务。芯片RTL测试跑通完整流程实打实的案例。另一方说“远达不到生产标准”。能解题、能修Bug,但代码没分层、没异常处理、没系统思维。“能拼出完整页面,但所有逻辑搅在一个文件里”。一个说能用,一个说不能用。其实都对看你怎么定义“用”。那问题来了:你觉得AI写代码,到什么程度才算“能用”?
发布于 北京
分享
评论
2
未登录
友善发言
image-upload
评论
加载中