宋宇寒
08-10 · 无
AI创作者AMA知无不言
让四个大模型买世界杯,准确率比瞎蒙还低
最近看到一篇挺有意思的研究,研究者让 Claude、ChatGPT、Gemini 和 Grok 预测了 2026 世界杯全部 104 场比赛。规则很简单,每场比赛开始前约24小时,让模型自己搜索新闻、伤病、阵容和赔率,然后完成三件事:给出胜、平、负的概率、拿100美元虚拟资金下注、比赛结束后,再复盘自己哪里判断错了。这个实验设计很巧,因为比赛结果还没有发生,所以“正确答案”不会提前出现在训练数据里。与此同时,博彩公司赔率又提供了一个现实世界中的强基准。结果很有意思。四个模型在 92%的比赛中选择了同一个最可能结果。ChatGPT 和 Grok 的胜负预测准确率都是 68.3%,市场也是 68.3%。如果进一步看概率预测质量,博彩市场的 Brier Score 反而是五个“选手”里最好的。也就是说,四个模型虽然都查了大量资料、进行了复杂推理,但最后对比赛结果的判断,与市场相比并没有形成明显优势。甚至我们简单的每场比赛都押100美元在市场热门球队上,最终也能赚1,041美元,绝对收益超过四个LLM。强如Claude ,下注ROI表现最差: -18.1%,ChatGPT 是 +8.0%,Gemini依旧美国豆包: +3.7%,Grok 是 +10.3%。四个模型对谁更可能赢的判断高度相似,但一旦进入实际决策,它们在下注多少、是否相信市场价格、什么时候选择反市场这些问题上,表现出了明显不同。论文还测了另一个很有意思的维度:模型在预测错误之后,能不能意识到自己错了,结果差异同样很大。有的模型在自己预测错误后,能在 86% 的情况下明确承认错误;有的只有 36%。过去很多 benchmark 主要关注回答是否正确。但如果未来越来越多的AI以 Agent 的形式参与真实决策,那么答对一道题显然只是其中一部分。两个模型即使给出了非常相似的判断,最终采取的行动、承担的风险,以及事后修正错误的能力,都可能完全不同。这也说明,未来的 AI Eval 可能需要更重视几个问题:预测是否准确,行动是否合理,风险是否可控,错误之后能否正确反思。当然,这项研究只有一届世界杯、104场比赛,短期ROI也不能被理解成稳定的盈利能力。但作为一种 benchmark 设计思路,它还是很有启发性的。
发布于 辽宁
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn