老陈聊AI
06-23·AI领域创作者
智谱上线并开源GLM-5.2模型
Cline实测:GLM5.2赢了?
GLM-5.2 发布后,最被关注的其实不是聊天能力,而是代码和 Agent 能力。它主打 long-horizon coding,支持 1M 上下文,开源权重,官方榜单里 Terminal-Bench 2.1、SWE-bench Pro 都比 GLM-5.1 明显提升;在 Arena 的 WebDev 榜单上,GLM-5.2 Max 也冲到了前排,尤其适合前端、代码、工具调用这类任务。但榜单归榜单,开发者更关心的是:真实项目里到底能不能干活?这次 Cline 官方亲自测了一把。Cline 不是普通网友,它本身就是一个开源 AI Coding Agent,很多开发者用它在编辑器和终端里读代码、改文件、跑命令、调用工具。所以 Cline 拿自己仓库里的一个真实 bug,让 GLM-5.2 和 Opus 4.8 在同一套提示词和工具环境下修。结果很有意思。两个模型都修好了问题,但过程完全不同:GLM-5.2 用了更多 token,大约 1.1M;Opus 4.8 约 660K。Opus 更快:1.6 分钟,12 次工具调用。GLM 更慢:4.7 分钟,28 次工具调用。但成本反过来了:GLM 只花 0.41 美元,Opus 花 0.81 美元。更关键的是质量差异。Cline 官方说,GLM 不只是修好了 bug,还清理了死代码,并在结束前验证了构建是否能编译成功;Opus 虽然测试通过,但留下了类型错误,导致生产构建被破坏。老陈想起来,之前大家一直有一个说法,更好更贵的Token,实际上对于解决问题,可能反而是最便宜的方案。但这次Cline的测试,说明了一个很重要的变化:国产开源模型已经不只是会刷榜,在真实 Coding Agent 场景里,也开始能打硬仗了。尤其是 GLM-5.2 这种工作方式:多花 token、多调用工具、多做验证,速度慢一点,但把构建链路跑完。对真实开发来说,这可能比“回答得快”更值钱。你会怎么选?如果你是技术负责人,团队每个月 AI 编程工具预算有限,你会怎么分?评论区可以报一下:你现在用 AI 写代码,一个月大概花多少钱?
发布于 陕西
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn