Analityka sportowa ma problem z infrastrukturą, a danych brakuje
Systemy, na których coraz częściej opiera się analityka sportowa, to te same systemy, które nie przechodzą audytów. 30 września szesnastoletni badacz ujawnił dostęp administracyjny do baz analitycznych Microsoftu, w których jest według szacunków 17 300 000 000 000 wierszy.

Ujawnienie opublikowane przez The Register 30 września to najnowszy element rosnącej sterty dowodów, że infrastruktura stojąca za analityką danych, także sportową, jest testowana szybciej, niż jest naprawiana.
Badacz, szesnastolatek znany jako Faav, odkrył, że wewnętrzna usługa analityczna Microsoftu o nazwie Titan sprawdzała zawartość tokenu JSON Web Token, ale nigdy nie weryfikowała jego podpisu. Według The Register dotarł do uprawnień administratora przez host Azure Cloud Services i mógł uruchamiać zapytania SQL na bazach analitycznych, które firma szacuje na 17 300 000 000 000 zapisanych wierszy. Microsoft zamknął API i wypłacił mu 5 000 dolarów nagrody za znalezienie błędu.
Co właściwie ujawnia ten błąd
Własny blog Faava, cytowany przez The Register, opisuje wadę w sposób, który powinien rozpoznać każdy zespół platformowy: "Kontrole uwierzytelniania przypominały hotel, w którym każde drzwi mają działający czytnik kart, ale każda karta otwierała każdy pokój." Mówi, że przepisał wpis na prośbę Microsoftu, wycinając fragmenty i liczby, a suma wierszy to szacunek pojemności wyprowadzony z metadanych, które prawdopodobnie obejmują dane historyczne i zduplikowane.
Microsoft przekazał Faavowi, w oświadczeniu zamieszczonym na jego blogu, że zgłoszenie "pomogło nam lepiej chronić klientów przez wzmocnienie naszych usług".
Liczby stojące za tym jednym punktem końcowym to część, nad którą powinni się zatrzymać szefowie technologiczni w sporcie. Same metadane obejmowały 24 569 pulpitów, 425 891 wykresów i 27 347 definicji zbiorów danych, według The Register. Trzydzieści aktywnych wartości routingu prowadziło przez 24 konfiguracje do 17 połączonych baz analitycznych obejmujących 9 863 unikalne nazwy tabel. Taki jest kształt nowoczesnego zasobu analitycznego: rozproszony, sfederowany i trzymany razem przez logikę uwierzytelniania, która jest tak mocna jak jej najsłabsze ogniwo.
Organizacje sportowe nie są wymienione w ujawnieniu o Titan. Ale ten sam wzorzec, centralna warstwa analityczna, która po cichu gromadzi dane z wielu źródeł, to dokładnie to, co sektor budował przez ostatnie dwa lata.
Ład korporacyjny przychodzi przed tablicą wyników
Dwie inne historie z ostatnich 48 godzin pokazują nacisk idący z przeciwnej strony, od społeczeństwa i regulatorów, a nie od atakujących.
"Skala tego społecznego sprzeciwu powinna być ogromnym sygnałem alarmowym dla rządu."
To Veronica Hawking z grupy kampanijnej 38 Degrees, cytowana przez The Guardian 30 września, po tym jak ponad 44 000 osób złożyło prawne sprzeciwy na podstawie artykułu 21 brytyjskiego Ogólnego rozporządzenia o ochronie danych, aby uniemożliwić opartej na Palantirze Federated Data Platform NHS przetwarzanie ich danych zdrowotnych. Palantir twierdzi, że platforma pomaga skracać listy oczekujących, podając 117 000 dodatkowych operacji i 14,3% redukcji opóźnień w wypisach u długoterminowych pacjentów. NHS England mówi, że organizacje zachowują kontrolę nad swoimi danymi. Sprzeciwiający się nie zgadzają się i spór jest teraz proceduralny, nie retoryczny.
W Holandii problem ujawniania danych wygląda odwrotnie. Badanie Lighthouse Report z Trouw i innymi europejskimi mediami, opisane przez NL Times 30 września, wykazało, że mniej niż jedna czwarta większych holenderskich centrów danych publikuje dane o zużyciu energii elektrycznej i wody pitnej. Europejska dyrektywa o efektywności energetycznej wymaga raportowania od obiektów powyżej 500 kW od trzech lat. Holenderska Agencja ds. Przedsiębiorczości ma dane tylko o 104 z 186 kwalifikujących się komercyjnych centrów danych zidentyfikowanych przez Dutch Datacenter Association, a publiczne dane istnieją dla 44 obiektów w zakresie energii elektrycznej i 47 w zakresie wody.
Statistics Netherlands podaje, że holenderskie centra danych zużyły 5 100 000 000 kWh w 2024 roku, co stanowi 4,6% krajowego zużycia. Operator sieci TenneT prognozuje 10 do 15% do 2030 roku.
Pytanie o moc obliczeniową stojące za analityką
Analityka sportowa znajduje się na konsumenckim końcu tego łańcucha dostaw. Każdy system śledzenia, każdy model oczekiwanych goli i każda augmentacja transmisji działają na infrastrukturze, której koszt, traktowanie podatkowe i ślad środowiskowy są na nowo negocjowane publicznie.
Wykorzystanie przez Metę federalnej ulgi podatkowej na badania to dobry przykład. The Decoder poinformował 30 września, cytując New York Times, że Meta zaoszczędziła 3 900 000 000 dolarów w 2025 roku, klasyfikując centra danych AI jako "modele pilotażowe", a chipy Nvidii jako materiały eksperymentalne, w porównaniu z 2 000 000 000 dolarów rok wcześniej i 700 000 000 dolarów w 2023 roku. Meta ostrzega w dokumentach dla SEC, że oszczędności mogą zostać zakwestionowane, a rezerwy na niepewne pozycje podatkowe wzrosły o 45% do 18 740 000 000 dolarów. Firma wskazuje na 200 000 000 000 dolarów wydatków na badania i rozwój w ciągu pięciu lat. Jej audytor, EY, zatwierdził tę strategię.
Tymczasem prace inżynieryjne trwają. Amazon Web Services poinformował 30 września, że Aurora PostgreSQL może teraz odpytywać dane Apache Iceberg i Parquet w Amazon S3, S3 Tables lub AWS Glue Data Catalog bez potoków ekstrakcji, transformacji i ładowania, używając silnika zapytań DuckDB osadzonego w PostgreSQL. Ta funkcja jest ogólnie dostępna w Aurora PostgreSQL 17.11 i 18.6 oraz nowszych, bez dodatkowych opłat. Dla zespołów danych sportowych usuwa to krok kopiowania między jeziorem danych a bazą operacyjną, w którym powstaje większość skarg na opóźnienia.
Nic z tego nie jest prognozą o rynku analityki sportowej. To opis gruntu, na którym on stoi. Ujawnienie o Titan, sprzeciwy wobec NHS i holenderska luka w raportowaniu to trzy wersje tego samego odkrycia: dane są, analityka działa, a kontrole wokół jednego i drugiego odkrywają najpierw niewłaściwi ludzie.
Źródła
5- 0116-year-old found Microsoft bug, got admin access to databases with 17.3 trillion rowsEN
- 02More than 44,000 file legal objections to Palantir NHS platform handling their dataEN
- 03Most data centers refusing to say how much water, electricity they useEN
- 04Meta dodges billions in US taxes by calling its AI data centers experimentsEN
- 05Aurora PostgreSQL now supports querying of Apache Iceberg and Parquet dataEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.