Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Sportowy stack danych przebudowuje się po cichu: co pokazały ostatnie 72 godziny

30 września Tigris opisał, dlaczego przeniósł kolejkę zadań asynchronicznych z FoundationDB do Kafki. To nie tekst o sporcie, ale opisuje dokładnie tę infrastrukturę, która dziś przenosi sportowe media o dużym wolumenie. Publikacja zbiegła się z tygodniem, w którym europejskie centra danych usłyszały, że nie mogą dłużej ukrywać zużycia wody i prądu.

SportAnalizaTomasz LisowskiOpublikowano: 30 września 20266 min czytaniaŹródła 6
Sportowy stack danych przebudowuje się po cichu: co pokazały ostatnie 72 godziny

Najbardziej użyteczna rzecz o technologii sportu, jaka ukazała się w ostatnich 72 godzinach, nie ma nic wspólnego ze sportem. 30 września dostawca pamięci obiektowej Tigris opisał, dlaczego przeniósł zadania asynchroniczne, na przykład odśmiecanie, z FoundationDB do Kafki. Powód jest istotny dla każdego, kto prowadzi analitykę sportową: jeśli worker padnie w trakcie zadania, zadanie pada razem z nim. "Gdy worker pobierze zadanie, nie ma go już w kolejce i zadanie ginie razem z nim" - napisała firma.

Sport to dziś stos dokładnie takich zadań. Feed trackingowy, pipeline wideo, rozliczanie zakładów, renderowanie skrótów. Żadne z nich nie toleruje zgubionej wiadomości.

Tigris mówi o kompromisie bez owijania w bawełnę. Część kolejek nadal trzyma w FoundationDB, bo baza eliminuje problem podwójnego zapisu, ale planowanie "wymaga wielu zapisów i skanów, co obciąża FoundationDB odczytami i bezpośrednio konkuruje z żądaniami użytkowników". Firma zaimplementowała artykuł Apple o QuiCK, systemie kolejek stojącym za CloudKit, i opisuje go jako "system kolejek, który używa Record Layer FoundationDB do zbudowania kolejki wiadomości opartej na czasie". Tekst jest też nietypowo zabawny w części o Kafce: porównuje samodzielny hosting do przebudzenia się jako "potworny robak", podczas gdy wszyscy uprzejmie proszą, żebyś ruszył dalej z życiem.

Sportowy wątek nie jest naciągany. Ligi i nadawcy od dekady obiecują relacje oparte na danych, a cała obietnica zwykle kończy się na dashboardzie. Pod spodem zostaje orkiestracja: które zdarzenia są przetwarzane, w jakiej kolejności i co się dzieje, gdy worker wywróci się o trzeciej nad ranem w trakcie meczu.

Europejskie centra danych milczą o liczbach

Tej samej daty holenderski portal NL Times opisał wyniki rocznego śledztwa Lighthouse Report, Trouw i innych europejskich redakcji dotyczącego raportowania środowiskowego centrów danych. Wniosek jest ostry: w Holandii mniej niż jedna czwarta większych centrów danych publikuje dane o zużyciu prądu i wody pitnej.

Liczby stojące za tą luką są konkretne. Według Dutch Datacenter Association pod koniec zeszłego roku w Holandii działało 186 komercyjnych centrów danych o mocach 500 kilowatów lub większych. Netherlands Enterprise Agency, która zbiera dane dla UE, ma dokumentację tylko na 104 z nich, a publiczne dane istnieją dla zużycia prądu 44 centrów i zużycia wody 47. Europejska dyrektywa o efektywności energetycznej wymaga raportowania na tym progu od trzech lat.

Statistics Netherlands szacuje zużycie prądu przez holenderskie centra danych na 5,1 mld kilowatogodzin w 2024 roku, czyli 4,6 proc. krajowego zużycia i blisko dwa razy więcej niż pięć lat wcześniej. Operator sieci TenneT prognozuje 10 do 15 proc. w 2030 roku. RVO ujawniła tego lata, że samo największe holenderskie centrum danych Microsoftu odpowiada za 1 proc. krajowego zużycia prądu. Google, które prowadzi w tym kraju dwa duże centra danych, nie podaje swoich liczb.

Dla sportu to nie jest abstrakcja. Streaming, tracking w czasie rzeczywistym i wizja komputerowa siedzą na tej samej sieci i w tej samej martwej strefie raportowania.

Zapytania do jeziora danych bez jego przenoszenia

Również 30 września AWS ogłosił, że Aurora PostgreSQL potrafi teraz odpytywać dane Apache Iceberg i Parquet bezpośrednio, przez tabele zewnętrzne, korzystając z silnika zapytań DuckDB osadzonego w PostgreSQL. Firma podaje, że funkcja jest ogólnie dostępna w Aurora PostgreSQL od wersji 17.11 i 18.6 we wszystkich regionach komercyjnych i GovCloud, bez dodatkowych opłat.

Obietnica dotyczy usunięcia ETL. "Dostęp do nich zwykle wymagał pipeline'ów kopiujących dane z jeziora danych do Aurory, co podnosiło koszty i pracę inżynierską w miarę zmian schematów" - czytamy w ogłoszeniu. Dla organizacji sportowej to różnica między jeziorem danych, które stoi w magazynie, a takim, o które analityk może realnie zapytać w trakcie sezonu.

Kluby i ligi przez cały tydzień obiecywały na targach branżowych sportowe ekosystemy oparte na danych. Consultancy-me.com opisał przedstawiciela Pure Sports, który mówił dokładnie o tym na LEAP 2026 29 września, a SVG Europe opublikowało tego samego dnia tekst o infrastrukturze dla mediów o dużym wolumenie. Żadna z tych publikacji nie jest premierą produktu. Obie opisują rynek, który zakłada, że warstwa danych działa.

Coraz częściej działa. I to jest ta historia.

Warstwa badawcza też się rusza

29 września badacze Osayamen Jonathan Aimuyo, Swapnil Gandhi i Christos Kozyrakis przesłali na arXiv artykuł opisujący Purlin, framework komunikacyjny, który rozdziela orkiestrację od ścieżki danych w kolektywach GPU. Praca podaje przyspieszenie opóźnień do 5,14x i poprawę przepustowości do 4,50x w siedmiu kolektywach na GPU A100, H200 i B200. Wbudowany w stos serwujący SGLang, Purlin poprawił przepustowość i interaktywność serwowania LLM w trybie offline średnio o 1,13x, a maksymalnie o 1,37x, oraz interaktywność wnioskowania online średnio o 1,26x, a maksymalnie o 2,85x, z największym zyskiem przy przeciążeniu.

To nie są benchmarki sportowe. Ale te obciążenia mają ten sam kształt co automatyczne generowanie skrótów, tracking z wielu kamer i wnioskowanie taktyczne w czasie rzeczywistym, gdzie opóźnienie pod obciążeniem jest całym produktem.

Dystans między 2,85x zysku na interaktywności w artykule a działającym systemem przy linii bocznej jest ogromny i nic w materiale nie sugeruje, żeby ktokolwiek go zamknął. Kierunek jest jednak spójny we wszystkich źródłach opublikowanych w tym tygodniu: ciekawa praca dzieje się poniżej interfejsu, w orkiestracji, silnikach zapytań i kolektywach sieciowych.

Czego tydzień nie rozstrzygnął

Nie rozstrzygnął kwestii prywatności. 30 września 404 Media poinformowało, że administracja Trumpa używa programu High Intensity Drug Trafficking Area z lat 80. do przesyłania lokalnych danych z automatycznych czytników tablic rejestracyjnych od Flock, Axon i innych dostawców do federalnych centrów nadzoru, a w niektórych przypadkach dalej do National License Plate Reader Program DEA. Dokumenty uzyskał w drodze wniosków o dostęp do informacji publicznej Cris van Pelt, twórca HaveIBeenFlocked.com. Jeramie Scott z Electronic Privacy Information Center powiedział 404 Media: "Jeśli wkurza cię Flock, to powinno wkurzać cię to" - podaje portal.

Obiekty sportowe są częścią tego parku kamer. Podobnie jak parkingi wokół nich.

Nie rozstrzygnął też kwestii danych medycznych. The Guardian poinformował 30 września, że ponad 44 000 osób złożyło formalne sprzeciwy na podstawie artykułu 21 unijnego RODO wobec obsługiwanej przez Palantira Federated Data Platform należącej do NHS England, a kampanierzy wskazują na prace Palantira dla izraelskiego wojska i amerykańskich służb imigracyjnych. Palantir twierdzi, że platforma pomaga skracać kolejki, podając 117 000 dodatkowych operacji, 14,3 proc. mniej opóźnień w wypisach pacjentów długoterminowych i 5,6 proc. poprawy w diagnozowaniu nowotworów w ciągu 28 dni.

Nie rozstrzygnął także kwestii środowiskowej. Śledztwo Lighthouse Report wykazało, że europejskie centra danych w większości nie chcą powiedzieć, ile zużywają wody i prądu, trzy lata po tym, jak obowiązek raportowania zaczął obowiązywać.

Złożone razem, ostatnie 72 godziny opisują sektor technologii sportowej, którego widoczna warstwa, dashboardy, grafiki trackingowe, komentarz AI, działa na niewidocznej warstwie przebudowywanej publicznie w blogach inżynierskich i preprintach na arXiv, podczas gdy jej koszty surowcowe i koszty prywatności pozostają w większości nieujawnione. To nie skandal. To problem pomiarowy i to na niego warto patrzeć.

Komentarze 0

Źródła

6
  1. 01We used a database as a message queue. Now we use Kafka.EN
  2. 02Most data centers refusing to say how much water, electricity they useEN
  3. 03Aurora PostgreSQL now supports querying of Apache Iceberg and Parquet dataEN
  4. 04Purlin: Separating Orchestration from the Datapath of CollectivesEN
  5. 05How Cities Are Forced to Funnel License Plate Data to a Massive Federal Surveillance ProgramEN
  6. 06More than 44,000 file legal objections to Palantir NHS platform handling their dataEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Tomasz Lisowski

Tomasz Lisowski

Sport, motoryzacja i podróże

Tomasz Lisowski w FLASH24 pisze o sporcie, motoryzacji i podróżach, opierając się na protokołach zawodów, danych technicznych i rozkładach jazdy, a nie na doniesieniach z drugiej ręki. Przy wynikach meczów sprawdza strzelców i minuty, a w testach samochodów porównuje zużycie paliwa z deklaracjami producenta. Rozmawia z mechanikami, sędziami i pracownikami kolei, a w kalendarzu czeka na starty sezonu i nowe trasy kolejowe po Europie. Po godzinach naprawia elektryki w garażu i jeździ pociągami po kontynencie, co przekłada się na teksty o motoryzacji i podróżach. Nie publikuje liczb ani terminów, których nie potwierdzi w dwóch źródłach.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.