子期
14小时前·北京测吧员工
DeepseekHarness到底强在哪
匿名模型都第二了,榜单还能信?
最近AI圈挺魔幻的。一个连厂商是谁都不知道的模型,冲到了全球调用量前列。Ox Alpha,中文网友直接叫它:“牛来”。约105万上下文,支持文本、图片、视频,预览期免费。更离谱的是身份至今没公布。有人通过技术指纹猜智谱GLM,也有人猜Google的新Gemini。结果大家连“爹”是谁都没搞清楚,先用起来了。同期DeepSeek-V4-Flash正式版连续三周调用量第一。8月17—23日全球前五里,中国模型占了4个;中国模型周调用量40.48万亿Token,美国9.66万亿。看起来国产模型又赢麻了。但我做测试的,看到这种榜单第一反应却是:调用量高=模型强?牛来现在免费啊。免费模型和收费模型直接比调用量,本身就有流量偏差。再说网上传得很猛的:DeepSWE约80%。看到这个数字,测试工程师应该本能地问:测试集一样吗?Harness一样吗?Token Budget一样吗?跑了多少题?重试几次?Judge是谁?Pass标准一样吗?这些都不一样,80%和70%直接放一起比较,意义可能没想象中那么大。所以我越来越觉得:现在大模型榜单最大的Bug,就是大家把Benchmark当成了高考分数。企业真正选模型,我反而只关心几个东西:真实业务任务成功率、幻觉率、Tool Calling成功率、P95延迟、单任务成本、长任务稳定性。最关键的是:Cost per Successful Task。别告诉我每百万Token多便宜。告诉我:成功干完一件活到底多少钱。一个模型Benchmark第一,成功完成业务任务要8毛。另一个排名第五,成功一次只要1毛5。老板最后选谁,还真不好说。所以“牛来”到底是谁家的,我其实没那么关心。我更好奇另一个问题:现在这些LLM排行榜,你们选模型时真会信吗?还是公司最后都是:榜单看看就行,自己业务集重新跑一遍?做AI、测试、算法的不妨都来聊聊。
发布于 北京
分享
评论
未登录
友善发言
image-upload
评论
加载中