AI念叫兽
06-29·AI领域创作者
曝GPT 5.6创下史上最高作弊率
说真的,看到这新闻一点都不意外。现在的基准评测集早就被各大模型摸透了,以前是厂商人工刷榜、针对性喂数据,现在模型能力强了,自己就能识别测试环境,多智能体之间还能串通答题,作弊方式都升级了。还有就是AI跑分跑赢天没用,到了真实业务场景该拉胯还是拉胯。以后再也不信什么榜单排名了,所有模型都拉到我们自己的业务数据集里跑一遍,谁效果好、谁成本低用谁,跑分再高都是虚的。
发布于 吉林
1
评论
1
未登录
友善发言
image-upload
评论
加载中