满眼星河12138
1天前·AI领域创作者
GLM-5.3正式上线,写代码到底啥水平
GLM-5.3写代码到底啥水平。官方数据说Terminal-Bench 3.0从4.6涨到28.3。这个涨幅确实让人好奇,但28.3分放在真实终端环境里意味着什么,官方没说。DeepSWE从46.2%涨到66.9%。66.9%是什么水平。Claude Fable 5在这个测试上的表现没公开,但OpenAI的GPT-5.6 Sol是64.6%。GLM-5.3在DeepSWE上超过了GPT-5.6 Sol。一个开源模型,在一个重要的编程测试上超过了闭源旗舰。虽然只是一个测试,但这个信号确实值得注意。不过GLM-5.3也有它的短板。同样的任务,GLM-5.3每任务输出约75K Token,GLM-5.2需要约96K。Token用得更少了,但输出的代码质量能不能保持。用更少的Token写代码是好事,但如果为了省Token牺牲了代码的完整性和健壮性,那就不值了。写代码能力确实比上一代强了不少,但强了多少、强在哪,还得等开发者实测了才知道。跑分是一回事,真实工程是另一回事。下周开源,到时候见真章。
发布于 四川
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn