跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

体育数据的底层正在被悄悄重建:过去72小时说明了什么

9月30日,Tigris发布了一篇事后复盘,讲它为什么把对象存储的队列从FoundationDB里搬出来,又把异步任务迁到Kafka。这不是体育新闻,但它描述的正是如今承载海量体育媒体的那套管道。同一周,欧洲的数据中心被告知,不能再把用水和用电数字当作秘密。

体育分析赵建国发布: 2026年9月30日6 分钟阅读资料来源 6
体育数据的底层正在被悄悄重建:过去72小时说明了什么

过去72小时里关于体育技术最有价值的一篇文章,跟体育本身毫无关系。9月30日,对象存储厂商Tigris发布工程复盘,解释为什么把垃圾回收这类异步任务从FoundationDB里搬出来,放到Kafka上。原因对任何做体育分析的人都重要:如果某个worker在任务执行到一半时挂掉,这个任务也就跟着没了。公司写道:“worker一旦取走任务,任务就不再在队列里,也就随它一起消失。”

现在的体育就是一堆这样的任务。追踪数据流、视频管道、博彩结算、集锦渲染。哪一个都经不起消息丢失。

Tigris对取舍说得很直接。它仍然把一部分队列留在FoundationDB里,因为数据库省掉了双写问题。但调度“需要大量写入和扫描,这会给FoundationDB带来读负载,直接和用户请求抢资源”。公司实现了苹果的QuiCK论文,也就是CloudKit背后的排队系统,并把它描述为“一个用FoundationDB的Record Layer实现、基于时间的消息队列”。这篇文章写Kafka时也难得地好笑,把自托管Kafka比作一觉醒来变成“一只巨大的害虫”,而周围人还客气地劝你继续过日子。

扯到体育并不牵强。各联盟和转播商花了十年承诺数据原生的报道,但说辞通常到仪表盘就停了。真正垫在底下的是编排:哪些事件被处理、按什么顺序、以及比赛进行到凌晨3点某个worker倒下时会发生什么。

欧洲数据中心对数字闭口不谈

同一天,荷兰媒体NL Times报道了Lighthouse Report联合Trouw及其他欧洲媒体为期一年的调查结果,调查对象是数据中心的环境信息披露。结论很刺眼:在荷兰,大型数据中心里公开用电和饮用水数字的不到四分之一。

这个缺口背后的数字很具体。据荷兰数据中心协会统计,截至去年年底,荷兰有186座容量在500千瓦及以上的商业数据中心。负责为欧盟收集数据的荷兰企业局只掌握其中104座的记录,而有公开用电数字的只有44座,有公开用水数字的47座。欧盟《能源效率指令》要求达到这一门槛的数据中心披露信息,已经要求了三年。

荷兰统计局给出的数字是,2024年荷兰数据中心用电51亿千瓦时,占全国用电量的4.6%,接近五年前水平的两倍。电网运营商TenneT预计到2030年这一比例会达到10%到15%。荷兰企业局今年夏天披露,仅微软在荷兰最大的数据中心就占全国用电量的1%。谷歌在荷兰运营着两座大型数据中心,但不公开自己的数字。

对体育来说这并不抽象。流媒体、实时追踪和计算机视觉都接在同一张电网上,也落在同一片信息披露的盲区里。

不搬数据也能查湖

同样在9月30日,AWS宣布Aurora PostgreSQL现在可以通过外部表直接查询Apache Iceberg和Parquet数据,用的是嵌入PostgreSQL的DuckDB查询引擎。公司表示,该能力从Aurora PostgreSQL 17.11和18.6版本起在所有商业区域和GovCloud区域正式可用,不额外收费。

卖点是省掉ETL。公告称:“过去要访问这些数据,通常得靠管道把数据从数据湖复制进Aurora,随着schema变化,成本和工程投入都会上升。”对一家体育机构来说,这决定了数据湖是躺在仓库里,还是分析师在赛季中真的能查。

各俱乐部和联盟这一周都在行业活动上承诺数据原生的体育生态。Consultancy-me.com在9月29日报道了一位Pure Sports负责人于LEAP 2026上谈的正是这件事,SVG Europe同一天也发了一篇讲海量媒体基础设施的文章。两者都不是产品发布。它们描述的是一个默认数据层能正常运转的市场。

它确实越来越能运转了。这就是故事本身。

研究层也在动

9月29日,研究者Osayamen Jonathan Aimuyo、Swapnil Gandhi和Christos Kozyrakis向arXiv提交了一篇论文,介绍Purlin,一个在GPU集合通信中把编排与数据通路分开的通信框架。论文报告称,在A100、H200和B200 GPU上的七种集合操作中,延迟最多加速5.14倍,带宽最多提升4.50倍。集成进SGLang服务栈后,Purlin把离线LLM服务的吞吐和交互性平均提升1.13倍、最高1.37倍,把在线推理的交互性平均提升1.26倍、最高2.85倍,过载时收益最大。

这些不是体育基准。但负载形态和自动集锦生成、多机位追踪、实时战术推理是一样的。在这些场景里,过载下的延迟就是产品本身。

论文里2.85倍的交互性提升和一套能用的场边系统之间隔着巨大的距离,档案里没有任何迹象表明有人填上了这个距离。不过本周发布的每一个来源指向的方向都一致:有意思的工作发生在界面之下,在编排、查询引擎和网络集合通信里。

这一周没有解决的问题

它没有解决隐私问题。9月30日,404 Media报道称,特朗普政府正利用1980年代的“高强度毒品贩运区”项目,把Flock、Axon等厂商的地方自动车牌识别数据导入联邦监控中心,某些情况下还会继续送往美国缉毒局的全国车牌识别项目。这些记录由HaveIBeenFlocked.com的创建者Cris van Pelt通过公共记录申请获得。电子隐私信息中心的Jeramie Scott对404 Media说:“如果你对Flock感到愤怒,那你对这件事也该感到愤怒。”

体育场馆就是这套摄像头资产的一部分。场馆周围的停车场也是。

它也没有解决健康数据问题。《卫报》9月30日报道,超过44000人依据英国GDPR第21条,对英格兰NHS由Palantir驱动的联邦数据平台处理自己的信息提出正式反对,活动人士提到Palantir为以色列军方和美国移民执法部门做过的工作。Palantir表示该平台正在帮助缩短等待名单,并列举了多出117000台手术、长期住院患者出院延误减少14.3%、28天内癌症诊断改善5.6%等数字。

它也没有解决环境问题。Lighthouse Report的调查发现,在披露义务生效三年后,欧洲数据中心大多仍不愿说明自己消耗了多少水和电。

把这些放在一起,过去72小时描述的体育技术行业是这样的:可见的那一层,仪表盘、追踪图形、AI解说,跑在一个看不见的层上。这个层正在公开的工程博客和arXiv预印本里被重建,同时它的资源和隐私代价基本没有披露。这不是丑闻。这是一个测量问题,也是值得盯住的那一个。

评论 0

资料来源

6
  1. 01We used a database as a message queue. Now we use Kafka.EN
  2. 02Most data centers refusing to say how much water, electricity they useEN
  3. 03Aurora PostgreSQL now supports querying of Apache Iceberg and Parquet dataEN
  4. 04Purlin: Separating Orchestration from the Datapath of CollectivesEN
  5. 05How Cities Are Forced to Funnel License Plate Data to a Massive Federal Surveillance ProgramEN
  6. 06More than 44,000 file legal objections to Palantir NHS platform handling their dataEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

赵建国

赵建国

体育、汽车与旅行

赵建国负责FLASH24的体育、汽车与旅行报道,主要从赛事官方数据、厂商技术公告和铁路运营时刻表提取信息,关注成绩、参数和行程的实际变化。在体育稿件中,他逐项核对比分、犯规次数和球员出场时间,并与联赛官网记录比对;汽车报道则对照工信部油耗与实测里程,不采用单一来源数据。他定期联系车队技师和4S店维修顾问,也等待欧冠抽签和日内瓦车展的日程,同时比较不同欧洲铁路通票的价格与换乘次数。业余时间他骑电动车、在车库做修理,并收集欧洲铁路线资料,这些习惯直接帮助他判断车辆故障描述和跨境线路的可行性。他坚持不发布未经二次核实的数字,宁可推迟发稿。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。