小葵爱晒太阳
1天前·后端开发·5年+
GLM-5.3正式上线,写代码到底啥水平
智谱说GLM-5.3"接近Fable 5",群里炸了——"国产终于站起来了" vs "又是自嗨"。我说个客观数据:在FrontierSWE(难度极高的软件工程评测)上,GLM-5.3排第二,仅次于Claude Fable 5,领先GLM-5.2一大截。在DeepSWE(长程代码修改)上得分从46.2跳到66.9。进步确实明显,但"接近"不是"平替"。 对标的意思是"在某些场景能掰手腕",不是"全面超越"。我实测的感觉:写常规代码、改Bug、做代码审查,和Fable 5差距已经不大;但复杂的长链条任务、需要多轮交互的Agent场景,还有距离。国产模型追得很快,这得认。但"对标"这个词,建议打个八折听。
发布于 江西
分享
评论
未登录
友善发言
image-upload
评论
加载中