乌贼在慕尼黑写BUG
1天前·测试·5年+
GLM-5.3真能对标Claude吗?
代码能力提升50%,但“对标”两个字别急着喊智谱官方说GLM-5.3在内部Z.ai Code Bench上比5.2提升了50%。DeepSWE从46.2到66.9,Terminal-Bench从4.6到28.3。数据确实漂亮。但实操中呢?知乎上有开发者实测,在代码工程、自主Agent、安全审计三个方向确实达到了相当水准。不过有个前提——GLM-5.3必须开启思考模式,不支持禁用。这意味着它默认就会“多想一步”,推理成本天然更高。还有一个容易被忽略的点:GLM-5.3在Max档位下准确率34.5%,输出约7.5万Token;而Claude Fable 5在Max档位准确率39.5%。差距还在。代码能力追上了不少,但说“对标”可能还得再跑几个真实项目验证。跑分好看和干活好用,你更在意哪个?
发布于 北京
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn