经典的足球比分模型。它拿每队的预期进球与被预期进球——先向各自的实力评级收缩——搭出一张网格,列出每个可能比分及其概率,其中对 0-0、1-1 这类低比分平局做了专门修正(原始模型往往会低估它们)。把整张网格加起来,就得到胜/平/负。它擅长还原足球比分真实的形状,也擅长把平局算准。
方法说明
每一场淘汰赛对阵,都由 8 个统计与机器学习模型,外加一个多校准融合来评估——只读两队在小组赛踢出来的足球数据,不看任何盘口、不看任何市场价格。对外公布的数字,就是 90 分钟内每种结果的概率:胜、平、负。
下面是完整的链条,从一份原始的 FIFA 赛后报告,一直到对外公布的预测。每一环喂给下一环,全程没有任何一步去读价格。
每场比赛之后,FIFA 都会发布一份《赛后总结报告》——大约五十页的详细分析。我们读其中两页上的文字:关键数据页(Key Statistics)和比赛阶段页(Phases of Play)。这就是全部的数据来源。
我们只读场上的足球:进球、射门、控球、逼抢、跑动距离这些。我们从不读价格、盘口或任何博彩数据——预测在生成时就刻意对市场保持盲测。
每支球队从这两页里读出 9 个数字。下面用大白话逐个解释,并各给一个示例值。
一支球队一场比赛预计能创造多少进球,依据是它制造的机会质量。越高越强。
一支球队预计会丢多少球,依据是它放给对手的机会。越低越强。
一支球队在整场比赛里控球的时间占比。
一支球队把比赛时间花在高位逼抢上的占比——在靠近对方球门的区域抢球。
一支球队处于快速反击阶段的时间占比。
一支球队退守到自家球门前防守的时间占比。
以高速(冲刺和快跑)跑出来的距离。用来看一支球队体能上拼得有多狠。
赛前对球队整体实力的估计,在第一脚球开球之前就定好。越高越强。
我们有数据的小组赛场次——3 场,整个小组赛。
“预期进球”(xG)是对射门质量的估计:它衡量一支球队创造(或放给对手)的机会到底值多少个进球,而不只是数那些恰好打进的球。
一支球队只踢三场小组赛,所以任何单个数字都很“吵”——一场反常的比赛就能把一支球队捧高或埋低。为了把它稳下来,我们先把三场取平均,再把每个数字轻轻拉向一个合理的先验。统计学上把这叫贝叶斯收缩:它相信数据,但不盲信,这样一场离谱的比赛就主导不了结果。
得到的就是球队画像——每支球队那张稳定、去噪后的样子,所有模型都从这里读起。从这一步往后,8 个模型用的都是同样的两张画像。
每个模型用不同的视角去看这两张画像,再把它变成一个胜/平/负。没有哪一个是最终定论;它们之间的分歧,恰恰是重点。下面是每个模型靠什么、又怎么下判断。
经典的足球比分模型。它拿每队的预期进球与被预期进球——先向各自的实力评级收缩——搭出一张网格,列出每个可能比分及其概率,其中对 0-0、1-1 这类低比分平局做了专门修正(原始模型往往会低估它们)。把整张网格加起来,就得到胜/平/负。它擅长还原足球比分真实的形状,也擅长把平局算准。
一个单一的实力评级,整个小组赛三场里随球队创造机会的质量——也就是预期进球——升降,而不只看最终比分。一支创造机会压过对手却输球的队,照样会涨。两队评级之差,再加上一个平局项,就变成胜/平/负。它奖励那些被结果“占了便宜”或“坑了”的球队。
它不给每队一个评级,而是分别保留一个进攻评级和一个防守评级,两者都用小组赛的预期进球来更新。预测一场对阵时,它拿一方的进攻去对另一方的防守,反之亦然,从而得到每队的进球预期。当一支球队很“偏科”时它最出彩——比如进攻很强、防守很漏——这种情况单一评级会糊成一团。
一个同时把体能负荷计入的实力评级。小组赛高强度跑动距离最多的球队会被小幅扣分,逻辑是它们在赛事深处更可能累。它专门用来抓住纯实力评级会漏掉的疲劳效应。
除了硬实力,它还比较两队实际怎么踢——控球、逼抢、反击、退守。风格上的相克,可能让评级更低的一方反而占优,就像在实力之上再叠一层石头剪刀布:一支出色的反击球队,能给一支评级更高的控球队制造麻烦。
一个梯度提升决策树模型——这是一种机器学习方法,会搭出许多小的决策规则再层层叠加。它用小组赛训练,喂进创造机会和打穿防线的数据(射门、过人线、向前推进),学出一套规律,把两队数字之间的差距映射成胜/平/负。
一个随机森林——另一种机器学习方法,是许多独立决策树的平均——用传球结构和打法风格的特征训练,比如控球和组织阵型。它是对同一个问题的另一种统计视角;它在哪里和梯度提升模型唱反调,本身就是信息。
一个元模型,它根本不看场上。它唯一的工作,是从前面七个模型在小组赛里的表现,学会该有多信任每一个——再把它们的看法加权、组合成一个判断。它是一个“关于模型的模型”。
8 种看法先被汇总成一个共识。然后一个在小组赛上学到的轻量偏差校正,在模型整体偏掉的地方做出微调。最后再上一道淘汰赛平局校准:淘汰赛 90 分钟内打平的比例,远高于小组赛——2022 卡塔尔世界杯约为 31%——所以对真正势均力敌的对阵,我们把平局抬向这个历史比例。实力悬殊的对阵几乎不动,热门一方也始终被保住。
得到的就是对外公布的“多校准 8 合 1”胜/平/负。每场比赛都把全部九种看法——8 个模型加上融合——并排展示在它自己的页面上,比赛打完后我们也公开为它们打分,任何人都能核对这份成绩单。