Aurora可直接查询Iceberg,16岁少年攻破微软Titan,Kafka迁移成焦点
9月30日,AWS让Aurora PostgreSQL可以直接查询Apache Iceberg和Parquet数据。本周体育分析团队面对的数据基础设施变动不止这一件。

体育机构用的底层管道和别人没什么两样:装满Parquet的对象存储、一个数仓、一个事务型数据库,再加一条让它们保持同步的队列。过去72小时里发表的三篇报道,讲的就是这条管道被拆开再重新组装。俱乐部、联赛或转播商能把一场比赛多快变成数字,直接受这件事影响。
Aurora接入DuckDB,ETL这一步消失了
AWS在9月30日表示,Aurora PostgreSQL现在可以同时查询运营数据和存放在Apache Iceberg、Parquet格式里的数据,用的还是现有的PostgreSQL应用和工具,不需要抽取、转换、加载管道,也不需要复制数据。客户创建PostgreSQL外部表,指向Amazon S3、Amazon S3 Tables或AWS Glue Data Catalog中的Iceberg或Parquet数据。根据AWS的What's New公告,Aurora通过嵌入PostgreSQL的DuckDB引擎执行这些查询。该功能已在Aurora PostgreSQL 17.11和18.6及更高版本上全面可用,覆盖所有AWS商业区域和GovCloud (US)区域,不额外收费。
对一套体育分析栈来说,这就是夜间批处理和比赛还在进行时就能跑出查询之间的差别。
它还消掉了一个已知的故障模式。AWS写道:“访问这些数据通常需要管道,把数据从数据湖复制进Aurora,随着schema演进,成本和工程投入都会上升。”AWS称,通过Glue Data Catalog联合的、兼容Iceberg REST Catalog的外部目录同样可用。对延迟敏感的工作负载,可以用标准SQL把Iceberg或Parquet数据物化成Aurora PostgreSQL原生表,无需ETL管道。
Quantum与Kafka:谁都不想迁两次的那次迁移
对象存储厂商Tigris在9月30日说明了它为什么把异步工作从FoundationDB搬到Kafka上。FoundationDB是它唯一使用的数据库。这篇文章对取舍讲得异常坦率,而它对应的正是体育数据工作负载:一条追踪数据流不能因为某个worker挂掉就丢事件。
Tigris曾在FoundationDB之上实现了QuiCK论文里的方案,也就是Apple用于CloudKit的排队系统。它能跑,但调度需要大量写入和扫描,与用户请求争资源,而且每个任务都要多次写入才能完成。新工程师还得学一套没有标准实现的定制代码。
Tigris对Kafka的吐槽值得整段引用,因为这正是多数体育数据团队会认出的那种抵触。Tigris的文章写道:“你有没有觉得自己像个塑料袋,随风飘荡,却没法重新开始,因为接下来是彻头彻尾的疯狂:花几个月排列组合JVM参数,只为榨出一点幽灵般的性能,好让服务器不至于一直着火?”文章随后承认这次迁移不是干净替换:队列仍留在FoundationDB,而垃圾回收之类的任务搬到了Kafka。文章说:“我们把垃圾回收这类异步任务移到Kafka,这样可以降低FDB的读写负载,也能砍掉相当一部分烦人的定制代码。”
任何用数据库当队列来跑实时体育数据流的人都该读一读。
17.3万亿行、一个16岁少年,和一个缺失的签名
本周阅读量最高的数据新闻不是产品发布。The Register在9月30日报道,一名16岁的安全研究员Faav在微软内部Titan分析服务中发现了一个认证缺陷,拿到了管理员权限,并在没有有效凭证的情况下运行了SQL。他进入的数据库估计存有17.3万亿行数据。
Titan通过网页界面只对微软员工开放。Faav用他自己搭建的AI黑客机器人Antares,经由一台Azure Cloud Services主机访问到Titan的API,因为Titan没有校验登录令牌的签名。微软此后锁定了该API,并支付了5000美元漏洞赏金。Faav在关于这些发现的博客中写道:“当时是凌晨两点。我想喊出来,或者至少出声说点什么,但我父母都睡了。所以我只是坐在那里盯着17,333,335,124,315,又把计算核对了一遍。”
The Register指出,Faav应微软要求重写了博客文章,在发表前删掉了部分段落和数字,并改写了影响描述。同一篇报道中微软给Faav的声明说:“他们的提交和协同漏洞披露,帮助我们加固服务,更好地保护了客户。”
对体育机构来说,真正相关的发现不是行数,而是Faav总结的教训:“Titan校验了JWT的内容(租户、受众、应用ID、用户),却从未验证签名,而签名是任何认证检查里最重要的部分。”每一个摄入运动员、医疗或球迷数据的分析平台都依赖同样的令牌检查。同样的失败不会自己发出声响。
管道归谁所有,谁又能看到里面
本周另外几篇报道显示,体育数据周边的治理层不是变简单,而是变难了。The Guardian在9月29日报道,美国卫生与公众服务部长Robert F Kennedy Jr提出了把医疗和生活方式数据连起来、用AI检索的计划,并称Medicaid是“一个非常有用的载体”,“里面有数亿人的生活”。运动医学和可穿戴数据就贴着这条管道,关于同意和二次使用的同样问题也适用。
The Guardian还在9月30日报道,超过44000人依据英国GDPR第21条提交法律异议,反对英格兰NHS由Palantir驱动的联邦数据平台处理他们的个人信息。Palantir英国及欧洲执行副总裁Louis Mosley指责批评者患上了“Palantir错乱综合征”。公司称其软件帮助信托机构多记录了117000台手术,长期住院患者的出院延误下降了14.3%。
同一天,404 Media报道,白宫国家毒品控制政策办公室利用HIDTA拨款项目,把Flock、Axon等厂商的本地车牌识别数据拉到联邦服务器上,有些情况下还转给DEA的国家车牌识别项目。电子隐私信息中心的Jeramie Scott对404 Media说:“如果你对Flock感到愤怒,那你对这件事也该感到愤怒。”
NL Times在9月30日报道,多数欧洲数据中心对环境影响保密,荷兰较大型设施中只有不到四分之一公布电力和饮用水数据,而欧盟能源效率指令下的这项义务已经生效三年。体育的数据中心面对的是同一个披露缺口。
合起来看
技术方向是清楚的。查询引擎正向数据所在的地方移动,队列正从数据库里分离出来,体育分析团队搭了十年的ETL复制环节正被厂商自己淘汰。治理方向则更乱:更多数据被连接,更多异议被提交,更多底层基础设施不对外披露。
两种趋势在同一个地方碰头。一个能在几秒内从Aurora查询自己数据湖的俱乐部,同时也是一个持有监管方、倡导者和攻击者如今都当作目标的数据的俱乐部。本周管道变快了,围绕它的争论没有变简单。
资料来源
7- 01Aurora PostgreSQL now supports querying of Apache Iceberg and Parquet dataEN
- 02We used a database as a message queue. Now we use Kafka.EN
- 0316-year-old found Microsoft bug, got admin access to databases with 17.3 trillion rowsEN
- 04RFK Jr outlines expansive vision for collecting US health data at Maha eventEN
- 05More than 44,000 file legal objections to Palantir NHS platform handling their dataEN
- 06How Cities Are Forced to Funnel License Plate Data to a Massive Federal Surveillance ProgramEN
- 07Most data centers refusing to say how much water, electricity they useEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。