乌贼在慕尼黑写BUG
07-01·测试·5年+
Sonnet 5能打Opus 4.8吗?
今天Sonnet 5上线,Anthropic官方定位是“迄今最具Agent能力的Sonnet”。尴尬的是Opus 4.8。编程差6%,计算机使用差2.2%,知识工作还被反超3分。价格却贵一大截。作为旗舰,面子往哪搁?但话说回来,Opus 4.8在深度推理和复杂判断上还是领先。漏洞利用测试中,Opus 4.8得分68.8%,Sonnet 5是13.2%。网络安全能力差好几倍Anthropic说这是故意的。所以不是Opus不行了,是Sonnet 5在特定场景下够用了。Anthropic临近IPO,需要Sonnet 5把实验性用量转化成生产级营收。这个时间点推“平替”,算盘打得响。
发布于 北京
分享
评论
未登录
友善发言
image-upload
评论
加载中