乌贼在慕尼黑写BUG
1天前·测试·5年+
GLM-5.3真能对标Claude吗?
代码能力提升50%,但“对标”两个字别急着喊智谱官方说GLM-5.3在内部Z.ai Code Bench上比5.2提升了50%。DeepSWE从46.2到66.9,Terminal-Bench从4.6到28.3。数据确实漂亮。但实操中呢?知乎上有开发者实测,在代码工程、自主Agent、安全审计三个方向确实达到了相当水准。不过有个前提——GLM-5.3必须开启思考模式,不支持禁用。这意味着它默认就会“多想一步”,推理成本天然更高。还有一个容易被忽略的点:GLM-5.3在Max档位下准确率34.5%,输出约7.5万Token;而Claude Fable 5在Max档位准确率39.5%。差距还在。代码能力追上了不少,但说“对标”可能还得再跑几个真实项目验证。跑分好看和干活好用,你更在意哪个?
发布于 北京
分享
评论
未登录
友善发言
image-upload
评论
加载中