Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Aurora Query, la breccia nel Titan di un sedicenne e la migrazione a Kafka

Il 30 settembre AWS ha reso Aurora PostgreSQL capace di interrogare direttamente i dati Apache Iceberg e Parquet. È uno dei cambiamenti all'infrastruttura dati che questa settimana arrivano sui team di analytics sportiva.

SportNotiziaMarco BianchiPubblicato: 30 settembre 20266 min di letturaFonti 7
Aurora Query, la breccia nel Titan di un sedicenne e la migrazione a Kafka

Le organizzazioni sportive poggiano sulla stessa impalcatura di tutti gli altri: object store pieni di Parquet, un warehouse, un database transazionale e una coda che tiene tutto sincronizzato. Tre storie pubblicate nelle ultime 72 ore raccontano di questa impalcatura smontata e rimontata. Per un club, una lega o un broadcaster cambia la velocità con cui una partita diventa un numero.

Aurora aggiunge DuckDB e lo step ETL sparisce

Il 30 settembre AWS ha annunciato che Aurora PostgreSQL può ora interrogare dati operativi insieme a dati memorizzati nei formati Apache Iceberg e Parquet. Si usano applicazioni e strumenti PostgreSQL esistenti, senza pipeline di extract, transform and load né duplicazione dei dati. I clienti creano foreign table PostgreSQL che fanno riferimento a dati Iceberg o Parquet su Amazon S3, Amazon S3 Tables o AWS Glue Data Catalog. Aurora esegue quelle query attraverso il motore di DuckDB, incorporato in PostgreSQL, secondo il post What's New di AWS. La funzionalità è generalmente disponibile su Aurora PostgreSQL 17.11 e 18.6 e versioni successive in tutte le regioni commerciali AWS e GovCloud (US), senza costi aggiuntivi.

Per uno stack di analytics sportiva è la differenza tra un batch notturno e una query che gira mentre la partita è ancora in corso.

Elimina anche una modalità di guasto nota. "Accedervi ha tipicamente richiesto pipeline che copiano i dati dal data lake in Aurora, facendo salire costi e lavoro di ingegneria man mano che gli schemi evolvono", ha scritto AWS. AWS afferma che funzionano anche i cataloghi esterni compatibili con Iceberg REST Catalog federati attraverso Glue Data Catalog. I carichi sensibili alla latenza, aggiunge, possono materializzare dati Iceberg o Parquet in tabelle native Aurora PostgreSQL con SQL standard, senza pipeline ETL.

Quantum e Kafka: la migrazione che nessuno vuole fare due volte

Il 30 settembre il fornitore di object storage Tigris ha spiegato perché ha spostato il lavoro asincrono fuori da FoundationDB, l'unico database che usa, e su Kafka. Il post è insolitamente franco sui compromessi. E si sovrappone bene ai carichi di dati sportivi, dove un feed di tracking non deve perdere un evento perché un worker è morto.

Tigris aveva implementato il paper QuiCK, il sistema di code che Apple usa per CloudKit, sopra FoundationDB. Funzionava, ma la schedulazione richiedeva molte scritture e scansioni, in competizione con le richieste degli utenti, e ogni attività richiedeva più scritture per essere completata. I nuovi ingegneri dovevano imparare codice personalizzato che non aveva un'implementazione standard.

L'obiezione dell'azienda a Kafka vale la pena di essere citata per esteso, perché è quella che la maggior parte dei team di dati sportivi riconoscerà. "Vi è mai capitato di sentirvi come un sacchetto di plastica che vaga nel vento ma non riesce a ripartire per la pura follia che comporta passare mesi a permutare flag della JVM per cercare di racimolare un briciolo di prestazioni da spettro, così che i vostri server non siano costantemente in fiamme?", chiede il post di Tigris. Poi ammette che la migrazione non è stato uno scambio pulito: le code restano in FoundationDB, mentre attività come la garbage collection sono passate a Kafka. "Abbiamo spostato attività asincrone come la garbage collection su Kafka, possiamo ridurre il carico di lettura e scrittura su FDB e limare buona parte di quel fastidioso codice personalizzato", si legge nel post.

Chiunque gestisca un feed di dati sportivi dal vivo su un pattern database-come-coda dovrebbe leggerlo.

17,3 trilioni di righe, un sedicenne e una firma mancante

La storia sui dati più letta della settimana non è il lancio di un prodotto. Il 30 settembre The Register ha riportato che un ricercatore di sicurezza sedicenne di nome Faav ha trovato un difetto di autenticazione nel servizio analytics interno di Microsoft, Titan. Ha ottenuto accesso da amministratore e ha eseguito SQL senza credenziali valide. Il database che ha raggiunto conteneva una stima di 17.300.000.000.000 di righe archiviate.

Titan è riservato ai dipendenti Microsoft attraverso la sua interfaccia web. Faav, lavorando con un AI hackbot che ha costruito e chiamato Antares, ha raggiunto l'API di Titan attraverso un host di Azure Cloud Services perché Titan non controllava la firma su un token di login. Microsoft ha poi bloccato l'API e pagato un bug bounty di 5.000 dollari. "Erano le 2 di notte", ha scritto Faav in un blog sui risultati. "Volevo urlare, o almeno dire qualcosa ad alta voce, ma i miei genitori dormivano. Così sono rimasto lì a fissare 17.333.335.124.315 e a ricontrollare i calcoli."

The Register nota che Faav ha riscritto il suo post su richiesta di Microsoft, tagliando sezioni e numeri e riformulando l'impatto prima della pubblicazione. La dichiarazione di Microsoft a Faav, riportata nello stesso pezzo, dice: "La loro segnalazione e la divulgazione coordinata delle vulnerabilità ci hanno aiutato a proteggere meglio i nostri clienti rafforzando i nostri servizi."

Per le organizzazioni sportive, il risultato rilevante non è il numero di righe. È la lezione che Faav ne ha tratto: "Titan convalidava il contenuto del JWT (tenant, audience, app ID, utente) ma non verificava mai la firma, la parte più importante di qualsiasi controllo di autenticazione." Ogni piattaforma di analytics che acquisisce dati di atleti, cartelle mediche o tifosi si affida allo stesso controllo del token. Lo stesso errore non si annuncerebbe da solo.

Chi possiede la pipeline e chi può guardarci dentro

Altre tre storie di questa settimana mostrano che il livello di governance attorno ai dati sportivi sta diventando più difficile, non più semplice. Il 29 settembre The Guardian ha riportato che il segretario alla Salute degli Stati Uniti Robert F Kennedy Jr ha illustrato piani per collegare dati medici e di stile di vita e interrogarli con l'IA. Ha citato Medicaid come "un veicolo davvero utile" con "centinaia di milioni di vite là dentro". La medicina sportiva e i dati dei wearable stanno accanto a quella pipeline, e valgono le stesse domande su consenso e uso secondario.

The Guardian ha anche riportato il 30 settembre che oltre 44.000 persone hanno presentato obiezioni legali ai sensi dell'articolo 21 del GDPR britannico contro la gestione delle loro informazioni personali da parte della Federated Data Platform di NHS England, alimentata da Palantir. Louis Mosley, vicepresidente esecutivo di Palantir per Regno Unito ed Europa, ha accusato i critici di "sindrome da delirio Palantir". L'azienda sostiene che il suo software ha aiutato i trust a registrare 117.000 interventi aggiuntivi e una riduzione del 14,3% nei ritardi di dimissione per i pazienti di lunga degenza.

Lo stesso giorno, 404 Media ha riportato che l'Office of National Drug Control Policy della Casa Bianca usa il programma di sovvenzioni HIDTA per portare dati locali dei lettori di targhe di Flock, Axon e altri fornitori su server federali. In alcuni casi li inoltra al National License Plate Reader Program della DEA. Jeramie Scott dell'Electronic Privacy Information Center ha detto a 404 Media: "Se siete incazzati per Flock, dovreste essere incazzati per questo."

E NL Times ha riportato il 30 settembre che la maggior parte dei data center europei tiene segreto il proprio impatto ambientale. Meno di un quarto delle strutture olandesi più grandi pubblica cifre su elettricità e acqua potabile, contro un obbligo della direttiva europea sull'efficienza energetica in vigore da tre anni. I data center dello sport sono soggetti allo stesso vuoto di rendicontazione.

Il bilancio

La direzione tecnica è chiara. I motori di query si spostano dove i dati già risiedono, le code vengono separate dai database, e la copia ETL che i team di analytics sportiva hanno costruito per un decennio viene deprecata dai fornitori stessi. La direzione della governance è più confusa: più dati collegati, più obiezioni presentate, più infrastruttura sottostante non divulgata.

Le due tendenze si incontrano nello stesso punto. Un club che riesce a interrogare il suo lake da Aurora in pochi secondi è anche un club che detiene dati che autorità, attivisti e attaccanti ora trattano come un bersaglio. Questa settimana la pipeline è diventata più veloce. Le discussioni su di essa non sono diventate più semplici.

Commenti 0

Fonti

7
  1. 01Aurora PostgreSQL now supports querying of Apache Iceberg and Parquet dataEN
  2. 02We used a database as a message queue. Now we use Kafka.EN
  3. 0316-year-old found Microsoft bug, got admin access to databases with 17.3 trillion rowsEN
  4. 04RFK Jr outlines expansive vision for collecting US health data at Maha eventEN
  5. 05More than 44,000 file legal objections to Palantir NHS platform handling their dataEN
  6. 06How Cities Are Forced to Funnel License Plate Data to a Massive Federal Surveillance ProgramEN
  7. 07Most data centers refusing to say how much water, electricity they useEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Marco Bianchi

Marco Bianchi

Sport, auto e viaggi

Marco Bianchi si occupa di sport, auto e viaggi per FLASH24, lavorando su dati ufficiali, comunicati di squadre e costruttori e calendari federali, senza lasciar passare numeri non verificati. Per lo sport confronta statistiche di campionato con i referti e ricontrolla gli episodi VAR prima di pubblicare. Su auto e viaggi attende i listini e le prove su strada, parla con concessionari e uffici stampa e compara allestimenti e consumi dichiarati. Fuori dalla redazione segue le statistiche di campionato, le polemiche sul VAR e il basket amatoriale, spesso con lo stesso metodo applicato agli articoli. Non pubblica una classifica o un dato di gara senza averlo verificato almeno due volte.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.