Shamater
07-01·AI领域创作者
Claude Opus 4.8
AI创作者AMA知无不言
Claude Sonnet 4.6
实测Sonnet 5,编程表现确实扎实!
刚才顺手把默认模型切到了 claude-sonnet-5,随便抛了个“你好”测试,它愣是“思考”了4秒才回,底下还标注了“Cogitated for 5s”。这仪式感,不愧是Anthropic的作风。翻了眼它和4.6、Opus 4.8的横向对比,心里踏实了不少。Agentic coding 在 SWE-bench Pro 上跑到 63.2%,虽然没到 Opus 的 69.2%,但比起 4.6 的 58.1% 还是稳稳胜出。Computer use(OSWorld-Verified),直接干到了 81.2%,比 4.6 高了近3个点。这意味着什么?意味着在处理那些繁琐的系统级操作时,它能替我省下更多精力。至于多学科推理,57.4% 的成绩配合工具使用,日常查资料、做分析完全够用。对于大多数开发者和知识工作者来说,这个性能提升是实打实的,不需要吹嘘,看着数据就能安心干活了。
发布于 江西
1
评论
1
未登录
友善发言
image-upload
评论
加载中