
上个月部门搞世界杯竞猜要猜决赛对阵和比分。纯足球小白的我仔细挑了两队提交立马被指出选得不合理。本人强装镇定“就这样吧。”但弄懂了规则后就换掉了之前的选择没别的原因纯粹是为了奖品。结果第二天直接遭受暴击某位资深球迷同事疯狂吐槽“这大模型也太蠢了同一半区的队伍怎么可能一起进决赛”(这里科普一下懂球的朋友可以跳过世界杯淘汰赛分上下半区同半区的队伍半决赛就得交手只有各自半区的胜者才能会师决赛。)尴尬来了当初我蒙的组合刚好也是同半区……本来以为这只是属于足球小白的专属失误大模型啃了海量数据好歹该懂基础赛制吧实在好奇我找来千问、豆包、文心、元宝、DeepSeek和Kimi六款大模型分别进行了三轮测试看看到底是怎么个情况。我给出的问题是帮我预测2026世界杯的结果最终决赛球队及比分谁会获得金球奖第一轮测试32强淘汰赛对阵刚出炉测试时小组赛刚打完决赛比分、金球奖归属需等到决赛结束才会揭晓因此先检验各模型预测结果的合理性。大模型的预测结果如下可以看到豆包和元宝预测的决赛队伍是法国和西班牙两队同属上半区半决赛必然相遇违反分区逻辑。第二轮测试八分之一决赛结束后为了确保公平我将大模型APP都升级到了测试时的最新版本分别是千问v6.12.5.2922豆包v14.0.0文心v5.15.0元宝v2.75.0.40DeepSeek v2.2.1(3)及Kimi v3.0.0。大模型给出的结果如下好消息是元宝终于修正了同半区的错误选出了合理的跨半区对决;坏消息是豆包依然坚持己见仍然预测法国与西班牙会师决赛并且文心和Kimi也出现了同样的赛制理解偏差给出的决赛组合依然来自同一半区。第三轮测试四分之一决赛结束后这次又拉来了两位国际选手Gemini 3.5 Flash和GPT-5.5 Instant并且增加了两个问题1、预测2026世界杯的冠亚季军;2、预测2026世界杯半决赛晋级情况和比分。本轮测试的时间点临近半决赛所以等到比赛结束后就能基本知道大模型的预测结果是否准确了。大模型给出的结果如下这一轮结果可以说是几家不欢喜几家愁更愁。7月15日西班牙2-0战胜法国队8款大模型中有6款预测法国赢剩下2款预测两队打平谁也没有猜到西班牙能零封法国。7月16日阿根廷2-1淘汰英格兰晋级决赛各路大模型再度失算。本以为要等到在7月20日决赛结束后才能验证竞猜结果但现实很打脸两天两场半决赛大模型集体翻车。写在最后总而言之言而总之让大模型预测世界杯这事猜对了是运气猜错了是常态。毕竟足球运动本身充满各种偶然性瞬息万变的赛场走势、临场状态的起伏根本不是靠海量数据就能精准预判的。而且你看有些大模型连基础赛制都搞不明白预测结果也就图一乐千万别当真。