L'analisi sportiva ha un problema di infrastruttura, e i dati mancano
I sistemi su cui girano sempre più spesso le analisi sportive sono gli stessi che ora non superano gli audit: il 30 settembre una ricercatrice sedicenne ha rivelato di avere accesso da amministratore ai database analitici di Microsoft, che secondo le stime contengono 17.300.000.000.000 di righe.

La rivelazione, pubblicata da The Register il 30 settembre, è l'ultimo tassello di un mucchio crescente di prove: le tubature dietro l'analisi dei dati, sport compreso, vengono messe alla prova più in fretta di quanto vengano riparate.
La ricercatrice, una sedicenne nota come Faav, ha scoperto che il servizio analitico interno di Microsoft, Titan, verificava il contenuto di un JSON Web Token ma non ne controllava mai la firma. Secondo The Register, è arrivata all'accesso da amministratore attraverso un host di Azure Cloud Services e poteva eseguire query SQL sui database analitici che l'azienda stima in 17.300.000.000.000 di righe archiviate. Microsoft ha bloccato l'API e le ha pagato un bug bounty di 5.000 dollari.
Cosa espone davvero il bug
Il blog di Faav, citato da The Register, descrive il difetto con parole che qualsiasi team di piattaforma riconoscerebbe: "I controlli di autenticazione sembravano un albergo dove ogni porta aveva un lettore di tessere funzionante, ma qualsiasi tessera apriva qualsiasi stanza." Faav dice di aver riscritto il post su richiesta di Microsoft, tagliando sezioni e numeri. Aggiunge che il totale delle righe è una stima di archiviazione ricavata dai metadati, che probabilmente includono dati storici e duplicati.
Microsoft ha detto a Faav, in una dichiarazione riportata nel suo blog, che la segnalazione "ci ha aiutato a proteggere meglio i nostri clienti rafforzando i nostri servizi".
I numeri dietro quel singolo endpoint sono la parte su cui i responsabili della tecnologia sportiva dovrebbero soffermarsi. I soli metadati coprivano 24.569 dashboard, 425.891 grafici e 27.347 definizioni di dataset, secondo The Register. Trenta valori di routing attivi risolvevano attraverso 24 configurazioni in 17 database analitici collegati, per un totale di 9.863 nomi di tabella unici. È la forma di un moderno patrimonio analitico: disperso, federato e tenuto insieme da una logica di autenticazione che è forte quanto il suo controllo più debole.
Nel caso Titan non vengono nominate organizzazioni sportive. Ma lo stesso schema, uno strato analitico centrale che aggrega silenziosamente dati da molte fonti, è esattamente ciò che il settore ha costruito negli ultimi due anni.
La governance arriva prima del tabellone
Altre due storie delle ultime 48 ore mostrano la pressione che arriva dall'altra direzione, dal pubblico e dalle autorità di regolamentazione più che dagli attaccanti.
"La portata di questa reazione pubblica dovrebbe essere un enorme campanello d'allarme per il governo."
È Veronica Hawking del gruppo di campagna 38 Degrees, citata da The Guardian il 30 settembre, dopo che più di 44.000 persone hanno presentato obiezioni legali ai sensi dell'articolo 21 del Regolamento generale sulla protezione dei dati del Regno Unito. L'obiettivo è impedire alla Federated Data Platform del NHS, alimentata da Palantir, di trattare i loro dati sanitari. Palantir afferma che la piattaforma aiuta a ridurre le liste d'attesa, citando 117.000 operazioni aggiuntive e una riduzione del 14,3% nei ritardi di dimissione per i pazienti di lunga degenza. NHS England afferma che le organizzazioni mantengono il controllo dei propri dati. Gli obiettori non sono d'accordo, e la disputa ora è procedurale, non retorica.
Nei Paesi Bassi il problema della trasparenza va nella direzione opposta. Uno studio di Lighthouse Report con Trouw e altri media europei, riportato da NL Times il 30 settembre, ha rilevato che meno di un quarto dei data center olandesi di grandi dimensioni pubblica cifre sul consumo di elettricità e acqua potabile. La direttiva europea sull'efficienza energetica richiede la rendicontazione per i siti sopra i 500 kW da tre anni. L'Agenzia nazionale per le imprese dei Paesi Bassi ha dati solo su 104 dei 186 data center commerciali idonei individuati dall'Associazione olandese dei data center. Esistono cifre pubbliche per 44 sull'elettricità e 47 sull'acqua.
L'ufficio statistico olandese stima il consumo elettrico dei data center olandesi in 5.100.000.000 kWh nel 2024, il 4,6% del consumo nazionale. L'operatore di rete TenneT prevede il 10-15% entro il 2030.
La questione del calcolo dietro l'analisi
L'analisi sportiva si trova all'estremità del consumo di quella catena di fornitura. Ogni sistema di tracciamento, ogni modello di gol attesi e ogni arricchimento delle trasmissioni gira su un'infrastruttura il cui costo, trattamento fiscale e impronta ambientale vengono rinegoziati in pubblico.
L'uso da parte di Meta di un credito d'imposta federale per la ricerca è un caso esemplare. The Decoder ha riportato il 30 settembre, citando il New York Times, che Meta ha risparmiato 3.900.000.000 di dollari nel 2025 classificando i data center per l'IA come "modelli pilota" e i chip Nvidia come materiali sperimentali. La cifra è in aumento rispetto ai 2.000.000.000 dell'anno precedente e ai 700.000.000 del 2023. Meta avverte nei documenti depositati alla SEC che i risparmi potrebbero essere contestati, e gli accantonamenti per posizioni fiscali incerte sono saliti del 45% a 18.740.000.000 di dollari. L'azienda cita 200.000.000.000 di dollari di spesa in ricerca e sviluppo su cinque anni. Il suo revisore, EY, ha approvato la strategia.
Nel frattempo il lavoro di ingegneria continua. Amazon Web Services ha annunciato il 30 settembre che Aurora PostgreSQL può ora interrogare dati Apache Iceberg e Parquet in Amazon S3, S3 Tables o AWS Glue Data Catalog senza pipeline di estrazione, trasformazione e caricamento. Il sistema usa il motore di query di DuckDB integrato in PostgreSQL. La funzionalità è disponibile in generale su Aurora PostgreSQL 17.11 e 18.6 e versioni successive, senza costi aggiuntivi. Per i team di dati sportivi questo elimina un passaggio di copia tra il data lake e il database operativo, che è dove nasce la maggior parte delle lamentele sulla latenza.
Niente di tutto questo è una previsione sul mercato dell'analisi sportiva. È una descrizione del terreno su cui poggia. La rivelazione Titan, le obiezioni al NHS e il vuoto di rendicontazione olandese sono tre versioni della stessa scoperta: i dati ci sono, le analisi sono in funzione, e i controlli su entrambi vengono scoperti prima dalle persone sbagliate.
Fonti
5- 0116-year-old found Microsoft bug, got admin access to databases with 17.3 trillion rowsEN
- 02More than 44,000 file legal objections to Palantir NHS platform handling their dataEN
- 03Most data centers refusing to say how much water, electricity they useEN
- 04Meta dodges billions in US taxes by calling its AI data centers experimentsEN
- 05Aurora PostgreSQL now supports querying of Apache Iceberg and Parquet dataEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.