Shamater
19小时前·AI领域创作者
Cursor
SWE-Bench 时代结束了!Cursor 刚发布了全新的 CursorBench 评测基准,直接难哭了一票顶尖模型。以前大家卷“能不能解决问题”,现在 Cursor 要看“能不能高效解决”。结果就是,曾在 SWE-Bench 威名赫赫的 Claude Haiku 4.5 和 Sonnet 4.5 分数断崖式下跌。这说明什么?在真实的 token 约束下,光有智商不行,还得懂“性价比”!
发布于 北京
分享
评论
未登录
友善发言
image-upload
评论
加载中