柚子知AI遇
07-09·AI领域创作者
Claude Opus 4.8
DeepSeek-V4
Cursor
Grok 4.5
Grok
Grok4.5 对比 Claude 谁更适合开发?
省钱行,干活差点
7月9日凌晨Grok 4.5公开发布,我第一时间接了API跑了一下午代码任务,聊聊真实感受。先说数据。SWE Bench Pro 64.7%确实压了Opus 4.7的64.3%一头,DeepSWE 1.0的62.0%甚至超了Opus 4.8。600亿刀收购Cursor没白花——数万亿token的真实开发交互数据喂进去,算法对工程上下文的理解确实上来了。异步RL训练让模型在长程Agent任务里持续进化,机器学习里这种"边跑边学"的思路在编程场景是真对路。但一到实际项目就露馅了。我让它重构一个5万行的Go项目,上下文一长就开始丢模块依赖关系,Opus 4.8的512K窗口碾压性优势在这摆着。深度学习模型的长程记忆不是靠推理优化能补的,token省得再多,关键信息丢了就是白搭。价格确实香。2/2/6对比Opus的15/15/75,同样任务token消耗少4.2倍,综合成本差20倍。批量跑CI/CD的代码审查、自动修lint错误这种高频低复杂度活,Grok 4.5直接拉满。但涉及架构设计、跨文件重构这种需要"工程审美"的,Claude还是独一档。
发布于 上海
分享
评论
未登录
友善发言
image-upload
评论
加载中