Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Aurora fragt Iceberg ab, ein 16-Jähriger bricht in Titan ein, Kafka zieht um

AWS hat Aurora PostgreSQL am 30. September beigebracht, Daten aus Apache Iceberg und Parquet direkt abzufragen. Es ist eine von mehreren Änderungen an der Dateninfrastruktur, die diese Woche auf Sportanalytics-Teams zukommen.

SportNachrichtJonas WeberVeröffentlicht: 30. September 20266 Min. LesezeitQuellen 7
Aurora fragt Iceberg ab, ein 16-Jähriger bricht in Titan ein, Kafka zieht um

Sportorganisationen sitzen auf derselben Infrastruktur wie alle anderen: Object Stores voller Parquet-Dateien, ein Warehouse, eine transaktionale Datenbank und eine Queue, die alles synchron hält. Drei Berichte aus den vergangenen 72 Stunden beschreiben, wie diese Infrastruktur auseinandergenommen und neu zusammengesetzt wird. Für Vereine, Ligen und Sender hat das Folgen dafür, wie schnell aus einem Spiel eine Zahl wird.

Aurora bekommt DuckDB, der ETL-Schritt verschwindet

AWS teilte am 30. September mit, dass Aurora PostgreSQL nun operative Daten zusammen mit Daten in den Formaten Apache Iceberg und Parquet abfragen kann. Bestehende PostgreSQL-Anwendungen und Werkzeuge lassen sich weiter nutzen, Extract-Transform-Load-Pipelines und doppelte Datenhaltung fallen weg. Kunden legen PostgreSQL-Fremdtabellen an, die auf Iceberg- oder Parquet-Daten in Amazon S3, Amazon S3 Tables oder im AWS Glue Data Catalog verweisen. Aurora führt diese Abfragen über die DuckDB-Engine aus, die in PostgreSQL eingebettet ist, heißt es im AWS-What's-New-Beitrag. Die Funktion ist allgemein verfügbar ab Aurora PostgreSQL 17.11 und 18.6 in allen kommerziellen AWS-Regionen und in GovCloud (US), ohne Aufpreis.

Für einen Analytics-Stack im Sport ist das der Unterschied zwischen einem nächtlichen Batch-Lauf und einer Abfrage, die läuft, während das Spiel noch läuft.

Außerdem fällt ein bekanntes Ausfallmuster weg. "Accessing it has typically required pipelines that copy data from your data lake into Aurora, driving up costs and engineering work as schemas evolve", schrieb AWS. Laut AWS funktionieren auch externe, Iceberg-REST-Catalog-kompatible Kataloge, die über den Glue Data Catalog föderiert werden. Latenzempfindliche Workloads können Iceberg- oder Parquet-Daten mit Standard-SQL in native Aurora-PostgreSQL-Tabellen materialisieren, ohne ETL-Pipeline.

Quantum und Kafka: der Umzug, den niemand zweimal machen will

Der Object-Storage-Anbieter Tigris beschrieb am 30. September, warum er asynchrone Arbeit aus FoundationDB herausgeholt und auf Kafka verlagert hat. FoundationDB ist die einzige Datenbank, die Tigris nutzt. Der Beitrag ist ungewöhnlich offen über die Abwägungen, und er passt gut zu Sportdaten-Workloads, bei denen ein Tracking-Feed kein Ereignis verlieren darf, nur weil ein Worker ausgefallen ist.

Tigris hatte das QuiCK-Paper umgesetzt, das Queuing-System, das Apple für CloudKit nutzt, und zwar auf FoundationDB. Es funktionierte, doch die Planung erforderte viele Schreib- und Lesevorgänge, die mit Nutzeranfragen konkurrierten, und jede Aufgabe brauchte mehrere Schreibvorgänge bis zum Abschluss. Neue Entwickler mussten eigenen Code lernen, für den es keine Standardimplementierung gab.

Der Einwand des Unternehmens gegen Kafka verdient ein längeres Zitat, weil es der Einwand ist, den die meisten Sportdaten-Teams wiedererkennen dürften. "Have you ever felt like a plastic bag drifting through the wind but unable to start again because of the sheer madness that comes with spending months permuting JVM flags to try to eke out a spectre's worth of performance so that your servers aren't constantly on fire?", fragt der Tigris-Beitrag. Dann räumt er ein, dass der Umzug kein sauberer Tausch war: Queues bleiben in FoundationDB, während Aufgaben wie Garbage Collection zu Kafka wanderten. "We moved asynchronous tasks like garbage collection to Kafka, we can reduce the read and write load on FDB and shave off a good amount of that pesky custom code", heißt es in dem Beitrag.

Wer einen Live-Feed mit Sportdaten nach dem Muster Datenbank-als-Queue betreibt, sollte ihn lesen.

17,3 Billionen Zeilen, ein 16-Jähriger und eine fehlende Signatur

Die meistgelesene Datengeschichte der Woche ist kein Produktstart. The Register berichtete am 30. September, dass ein 16-jähriger Sicherheitsforscher namens Faav eine Authentifizierungslücke in Microsofts internem Analysedienst Titan gefunden hat. Er erlangte Administratorzugang und führte SQL ohne gültige Zugangsdaten aus. Die Datenbank, zu der er gelangte, enthielt schätzungsweise 17,3 Billionen gespeicherte Zeilen.

Titan ist über seine Weboberfläche auf Microsoft-Mitarbeiter beschränkt. Faav erreichte die Titan-API über einen Azure-Cloud-Services-Host, weil Titan die Signatur eines Login-Tokens nicht prüfte. Er arbeitete dabei mit einem selbst gebauten KI-Hackbot namens Antares. Microsoft hat die API inzwischen abgesichert und ein Fehlerkopfgeld von 5.000 Dollar gezahlt. "It was 2 AM", schrieb Faav in einem Blogbeitrag über die Funde. "I wanted to yell, or at least say something out loud, but my parents were asleep. So I just sat there staring at 17.333.335.124.315 and checked the math again."

The Register merkt an, dass Faav seinen Blogbeitrag auf Bitte von Microsoft überarbeitet hat: Er strich Abschnitte und Zahlen und formulierte die Auswirkungen vor der Veröffentlichung neu. Microsofts Stellungnahme an Faav, die im selben Artikel zitiert wird, lautet: "Their submission and coordinated vulnerability disclosure helped us to better protect our customers by hardening our services."

Für Sportorganisationen ist nicht die Zeilenzahl der relevante Befund, sondern die Lehre, die Faav daraus zieht: "Titan validated the contents of the JWT (tenant, audience, app ID, user) but never verified the signature, the most important part of any authentication check." Jede Analytics-Plattform, die Athleten-, Medizin- oder Fan-Daten aufnimmt, verlässt sich auf dieselbe Token-Prüfung. Derselbe Fehler würde sich nicht von selbst melden.

Wem die Pipeline gehört und wer hineinschauen darf

Drei weitere Berichte dieser Woche zeigen, dass die Governance-Schicht rund um Sportdaten eher schwieriger als einfacher wird. The Guardian berichtete am 29. September, dass der US-Gesundheitsminister Robert F. Kennedy Jr. Pläne vorgestellt hat, Medizin- und Lebensstildaten zu verknüpfen und mit KI zu durchsuchen. Medicaid nannte er "a really useful vehicle" mit "hundreds of millions of lives in there". Sportmedizin und Wearable-Daten liegen nahe an dieser Pipeline, und dieselben Fragen zu Einwilligung und Zweitnutzung stellen sich dort.

The Guardian berichtete außerdem am 30. September, dass mehr als 44.000 Menschen nach Artikel 21 der britischen DSGVO rechtliche Widersprüche dagegen eingelegt haben, dass NHS England ihre persönlichen Daten auf der Palantir-gestützten Federated Data Platform verarbeitet. Louis Mosley, Executive Vice President von Palantir für Großbritannien und Europa, hat Kritikern "Palantir derangement syndrome" vorgeworfen. Das Unternehmen erklärt, seine Software habe Trusts geholfen, 117.000 zusätzliche Operationen zu erfassen und Entlassungsverzögerungen bei Langzeitpatienten um 14,3 Prozent zu senken.

Am selben Tag berichtete 404 Media, dass das Office of National Drug Control Policy des Weißen Hauses über das HIDTA-Förderprogramm lokale Kennzeichenleser-Daten von Flock, Axon und anderen Anbietern auf Bundes-Server zieht. In einigen Fällen leitet es sie an das National License Plate Reader Program der DEA weiter. Jeramie Scott vom Electronic Privacy Information Center sagte zu 404 Media: "If you're pissed about Flock then you should be pissed about this."

Und NL Times berichtete am 30. September, dass die meisten europäischen Rechenzentren ihre Umweltbilanz geheim halten. Weniger als ein Viertel der größeren niederländischen Einrichtungen veröffentlicht Zahlen zu Strom- und Trinkwasserverbrauch, obwohl die europäische Energieeffizienzrichtlinie seit drei Jahren gilt. Die Rechenzentren des Sports unterliegen derselben Meldelücke.

Was das zusammen ergibt

Die technische Richtung ist klar. Abfrage-Engines wandern dorthin, wo die Daten ohnehin liegen, Queues werden von Datenbanken getrennt, und die ETL-Kopie, die Sportanalytics-Teams über ein Jahrzehnt aufgebaut haben, wird von den Anbietern selbst abgeschafft. Die Governance-Richtung ist unübersichtlicher: mehr verknüpfte Daten, mehr eingelegte Widersprüche, mehr verheimlichte Infrastruktur.

Beide Entwicklungen treffen am selben Punkt zusammen. Ein Verein, der seinen Data Lake in Sekunden von Aurora aus abfragen kann, ist auch ein Verein, dessen Daten Regulierer, Aktivisten und Angreifer inzwischen als Ziel betrachten. Die Pipeline ist diese Woche schneller geworden. Die Debatten darüber sind nicht einfacher geworden.

Kommentare 0

Quellen

7
  1. 01Aurora PostgreSQL now supports querying of Apache Iceberg and Parquet dataEN
  2. 02We used a database as a message queue. Now we use Kafka.EN
  3. 0316-year-old found Microsoft bug, got admin access to databases with 17.3 trillion rowsEN
  4. 04RFK Jr outlines expansive vision for collecting US health data at Maha eventEN
  5. 05More than 44,000 file legal objections to Palantir NHS platform handling their dataEN
  6. 06How Cities Are Forced to Funnel License Plate Data to a Massive Federal Surveillance ProgramEN
  7. 07Most data centers refusing to say how much water, electricity they useEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Jonas Weber

Jonas Weber

Sport, Auto und Reisen

Jonas Weber schreibt für FLASH24 über Sport, Autos und Reisen und stützt sich dabei auf Verbandsstatistiken, Herstellerangaben und eigene Recherchen vor Ort. Bei Ligaspielen prüft er Spielberichte gegen die offiziellen Datenbanken und gleicht Torschützen sowie Einsatzzeiten ab. Im Automobilbereich vergleicht er technische Daten aus Pressemappen mit unabhängigen Tests, im Reisenressort wartet er auf die saisonalen Streckenfreigaben und spricht mit Veranstaltern. Privat verfolgt er Ligastatistiken, diskutiert über den Videobeweis und spielt selbst Amateurbasketball. Zahlen, die er nicht belegen kann, veröffentlicht er nicht.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.