体育数据的底层正在被悄悄重建:过去72小时说明了什么
9月30日,Tigris发布了一篇事后复盘,讲它为什么把对象存储的队列从FoundationDB里搬出来,又把异步任务迁到Kafka。这不是体育新闻,但它描述的正是如今承载海量体育媒体的那套管道。同一周,欧洲的数据中心被告知,不能再把用水和用电数字当作秘密。

过去72小时里关于体育技术最有价值的一篇文章,跟体育本身毫无关系。9月30日,对象存储厂商Tigris发布工程复盘,解释为什么把垃圾回收这类异步任务从FoundationDB里搬出来,放到Kafka上。原因对任何做体育分析的人都重要:如果某个worker在任务执行到一半时挂掉,这个任务也就跟着没了。公司写道:“worker一旦取走任务,任务就不再在队列里,也就随它一起消失。”
现在的体育就是一堆这样的任务。追踪数据流、视频管道、博彩结算、集锦渲染。哪一个都经不起消息丢失。
Tigris对取舍说得很直接。它仍然把一部分队列留在FoundationDB里,因为数据库省掉了双写问题。但调度“需要大量写入和扫描,这会给FoundationDB带来读负载,直接和用户请求抢资源”。公司实现了苹果的QuiCK论文,也就是CloudKit背后的排队系统,并把它描述为“一个用FoundationDB的Record Layer实现、基于时间的消息队列”。这篇文章写Kafka时也难得地好笑,把自托管Kafka比作一觉醒来变成“一只巨大的害虫”,而周围人还客气地劝你继续过日子。
扯到体育并不牵强。各联盟和转播商花了十年承诺数据原生的报道,但说辞通常到仪表盘就停了。真正垫在底下的是编排:哪些事件被处理、按什么顺序、以及比赛进行到凌晨3点某个worker倒下时会发生什么。
欧洲数据中心对数字闭口不谈
同一天,荷兰媒体NL Times报道了Lighthouse Report联合Trouw及其他欧洲媒体为期一年的调查结果,调查对象是数据中心的环境信息披露。结论很刺眼:在荷兰,大型数据中心里公开用电和饮用水数字的不到四分之一。
这个缺口背后的数字很具体。据荷兰数据中心协会统计,截至去年年底,荷兰有186座容量在500千瓦及以上的商业数据中心。负责为欧盟收集数据的荷兰企业局只掌握其中104座的记录,而有公开用电数字的只有44座,有公开用水数字的47座。欧盟《能源效率指令》要求达到这一门槛的数据中心披露信息,已经要求了三年。
荷兰统计局给出的数字是,2024年荷兰数据中心用电51亿千瓦时,占全国用电量的4.6%,接近五年前水平的两倍。电网运营商TenneT预计到2030年这一比例会达到10%到15%。荷兰企业局今年夏天披露,仅微软在荷兰最大的数据中心就占全国用电量的1%。谷歌在荷兰运营着两座大型数据中心,但不公开自己的数字。
对体育来说这并不抽象。流媒体、实时追踪和计算机视觉都接在同一张电网上,也落在同一片信息披露的盲区里。
不搬数据也能查湖
同样在9月30日,AWS宣布Aurora PostgreSQL现在可以通过外部表直接查询Apache Iceberg和Parquet数据,用的是嵌入PostgreSQL的DuckDB查询引擎。公司表示,该能力从Aurora PostgreSQL 17.11和18.6版本起在所有商业区域和GovCloud区域正式可用,不额外收费。
卖点是省掉ETL。公告称:“过去要访问这些数据,通常得靠管道把数据从数据湖复制进Aurora,随着schema变化,成本和工程投入都会上升。”对一家体育机构来说,这决定了数据湖是躺在仓库里,还是分析师在赛季中真的能查。
各俱乐部和联盟这一周都在行业活动上承诺数据原生的体育生态。Consultancy-me.com在9月29日报道了一位Pure Sports负责人于LEAP 2026上谈的正是这件事,SVG Europe同一天也发了一篇讲海量媒体基础设施的文章。两者都不是产品发布。它们描述的是一个默认数据层能正常运转的市场。
它确实越来越能运转了。这就是故事本身。
研究层也在动
9月29日,研究者Osayamen Jonathan Aimuyo、Swapnil Gandhi和Christos Kozyrakis向arXiv提交了一篇论文,介绍Purlin,一个在GPU集合通信中把编排与数据通路分开的通信框架。论文报告称,在A100、H200和B200 GPU上的七种集合操作中,延迟最多加速5.14倍,带宽最多提升4.50倍。集成进SGLang服务栈后,Purlin把离线LLM服务的吞吐和交互性平均提升1.13倍、最高1.37倍,把在线推理的交互性平均提升1.26倍、最高2.85倍,过载时收益最大。
这些不是体育基准。但负载形态和自动集锦生成、多机位追踪、实时战术推理是一样的。在这些场景里,过载下的延迟就是产品本身。
论文里2.85倍的交互性提升和一套能用的场边系统之间隔着巨大的距离,档案里没有任何迹象表明有人填上了这个距离。不过本周发布的每一个来源指向的方向都一致:有意思的工作发生在界面之下,在编排、查询引擎和网络集合通信里。
这一周没有解决的问题
它没有解决隐私问题。9月30日,404 Media报道称,特朗普政府正利用1980年代的“高强度毒品贩运区”项目,把Flock、Axon等厂商的地方自动车牌识别数据导入联邦监控中心,某些情况下还会继续送往美国缉毒局的全国车牌识别项目。这些记录由HaveIBeenFlocked.com的创建者Cris van Pelt通过公共记录申请获得。电子隐私信息中心的Jeramie Scott对404 Media说:“如果你对Flock感到愤怒,那你对这件事也该感到愤怒。”
体育场馆就是这套摄像头资产的一部分。场馆周围的停车场也是。
它也没有解决健康数据问题。《卫报》9月30日报道,超过44000人依据英国GDPR第21条,对英格兰NHS由Palantir驱动的联邦数据平台处理自己的信息提出正式反对,活动人士提到Palantir为以色列军方和美国移民执法部门做过的工作。Palantir表示该平台正在帮助缩短等待名单,并列举了多出117000台手术、长期住院患者出院延误减少14.3%、28天内癌症诊断改善5.6%等数字。
它也没有解决环境问题。Lighthouse Report的调查发现,在披露义务生效三年后,欧洲数据中心大多仍不愿说明自己消耗了多少水和电。
把这些放在一起,过去72小时描述的体育技术行业是这样的:可见的那一层,仪表盘、追踪图形、AI解说,跑在一个看不见的层上。这个层正在公开的工程博客和arXiv预印本里被重建,同时它的资源和隐私代价基本没有披露。这不是丑闻。这是一个测量问题,也是值得盯住的那一个。
资料来源
6- 01We used a database as a message queue. Now we use Kafka.EN
- 02Most data centers refusing to say how much water, electricity they useEN
- 03Aurora PostgreSQL now supports querying of Apache Iceberg and Parquet dataEN
- 04Purlin: Separating Orchestration from the Datapath of CollectivesEN
- 05How Cities Are Forced to Funnel License Plate Data to a Massive Federal Surveillance ProgramEN
- 06More than 44,000 file legal objections to Palantir NHS platform handling their dataEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。