微学AI
06-29·AI领域创作者
豆包 2.1 代码能力能否比肩主流模型?
59.8分背后的冷思考
把字节官方 SciCode 榜单翻出来细看,豆包 2.1 Pro 59.8、GPT-5.5 58.4、Claude Opus 4.7 56.4。看上去豆包反超了,全网欢呼。但我注意到一个细节——字节自家报告里,编程相关评测"没有一项是第一",全在第一梯队贴边。NL2Repo 47 分宣称"大幅领先",可这榜单样本量本来就小,缺乏第三方独立复现;SWE-Bench Verified 这种公认硬核的榜单,豆包至今没放官方成绩,只丢出一份"内部众测胜率 59%"——自评测的水分大家心里有数。Terminal Bench 2.1"接近 Claude Opus 4.7",接近不等于持平,更不等于超越。我的判断是:豆包 2.1 Pro 的工程交付、长链路 Agent、仓库级理解是真本事;但单点代码质量、复杂算法这些"硬核 Coding"维度,和 GPT-5.5、Claude Opus 4.7 还有半档差距。国产模型第一次站到牌桌中央值得肯定,但封神还早,再让它飞一会儿。
发布于 福建
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn