用模型做球探:一场比赛两千个数据点,可比性却成了难题
如今俱乐部评估球员,靠的是算法算出的指标,从预期进球到防守压迫指数。一份中文的行业梳理却指出,这些模型彼此对不上的地方在哪里。

起点是数据够不够。一份中文梳理谈足球领域大规模数据集的使用,其中提到,一场职业比赛会产生两千多个数据点,涵盖跑动、传球和身体对抗。机器学习模型把多个来源的数据合在一起,用来估计球员今后的状态。这已经不是在描述单个事件,而是一股可测量的量流。
第二根支柱是预期类指标。预期进球模型(xG)给每一脚射门算出一个进球概率,再把所有数值加起来,看一支球队在创造出这些机会的情况下本该进多少球。实际进了多少,与这个数字无关。
同一脚射门,不同的数字
问题正是从这里开始的,分析人士对此再熟悉不过。当今的 xG 模型在特征选取上各不相同:有的看射门用的是身体哪个部位,有的看进攻怎么发起,有的看防守球员的压迫,还有的看位置。选择不同,同一脚射门算出来的估计就会系统性偏离。所以不同供应商给出的 xG 数值不能直接比较,尤其当其中一个模型用了另一个模型没有的上下文信息时。
实际结论对任何把两个联赛的球员放在一起比较的俱乐部都是一个警告:同一个球员的“进球减 xG”,换一家数据供应商就可能变样。样本很短的时候,差异往往只是噪声,反映的是模型的选择和偏差,不是球员的能力。
供应商的多样性
数据供应商市场高度集中,价值以十亿计。Opta 成立于 1996 年,为 70 多个国家的 30 多个运动项目提供数据,2019 年起归 Stats Perform 所有。在纽约证券交易所上市的 Genius Sports 约有 1500 名员工,服务 300 多个博彩品牌,每年提供 24 万场以上体育赛事的数据和转播。
整合并没有停下来。2026 年 2 月,Genius Sports 宣布以 12 亿美元收购 Legend 公司,后者拥有 Casino.org 和 Covers.com 两个品牌。消息公布后,该公司股价下跌 23%。市场如今对这一段位的收购定价有多紧张,由此可见。
俱乐部今天买的不是一套模型,而是买一个供应商、它对事件的定义和它的计算方式,连同它的全部错误。
所以对基于模型的球探工作来说,问题不是“有没有数据”,而是“谁的数据,以及我们比较的是不是同一个东西”。答案是:只要没有先确定供应商和指标定义,把两个名字放在一起比较就不是。
资料来源
4- 01科技赋能足球:大数据分析如何重塑球员评估与转会决策ZH
- 02Expected goalsEN
- 03Opta SportsEN
- 04Genius SportsEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。