Postgres、Luxir 与 SlopShape:搜索技术栈正在重建,出版商流量却在下滑
9月27日,PlanetScale 发布了一篇关于 Postgres 全文搜索的深度技术解析。这是这一周搜索基础设施发布潮中最新的一个,而与此同时,出版商报告搜索引荐流量大幅下滑。

这一周搜索技术栈的最新进展,不是来自搜索引擎。9月27日,PlanetScale 发布了《Anatomy of a (Postgres) Search Engine》,讲 Postgres 里的倒排索引怎么工作,以及它和大多数开发者最先想到的 b-tree 有什么不同。
PlanetScale 这篇文章提醒人们,搜索如今是数据库的一个功能,不只是一个产品品类。文章写道:“b-tree 无法匹配字符串中间的内容。”接着它展示了希望开发者别再用的写法:用前导通配符 LIKE 去逐行检查整张表。文章说,“几乎所有全文搜索引擎”都靠倒排索引定位文档,也就是按字段中每一个词单独建键。这是一个很小的架构点,却直接决定数据库回答一个问题能有多快。这篇解析对底层机制讲得异常具体。倒排索引有词项词典和倒排记录表,还可以额外加上位置和词频数据。倒排记录表先排序,再压缩:PlanetScale 举的例子是一份含 30 万篇文档的索引,其中 10 万篇包含 “who” 这个词。如果老老实实存每个 ID,每个倒排项要 19 位,但相邻 ID 之间的平均间隔是 3,两个位就够了。密集的表还能更进一步,直接存位图,当大约一半文档都含某个词时,位图就是最优选择。这只是压缩细节,却解释了为什么在大规模语料上做搜索还算便宜,也解释了为什么查询引擎能在一次 O(n) 扫描里取两个倒排记录表的并集或交集。PlanetScale 还提到,当表存成位图时,近年 CPU 上的向量指令一条就能对 128、256 甚至 512 位做 OR 或 AND。
Luxir 主张用一个引擎做全谱系搜索
五天前,也就是 9月22日,另一个叫 Luxir 的项目发布了自己的方案:一个开源引擎,在同一个请求里把全文搜索、向量搜索、分面搜索和分析结合起来。Luxir 的网站不从功能角度讲,而是从成本角度讲,称它“为每核、每 GB、每美元最多的搜索量而设计”,还说云客户“会永远为低效付费”。
架构上的说法很具体。工作窃取调度器把索引、合并和查询执行分摊到多个核上;网络 IO 是异步的,慢客户端不会占住一个核;段是不可变的、内存映射的,直接从页缓存里读。倒排项解码、打分和向量距离计算都走 SIMD 路径,top-k 请求用块最大值剪枝。Luxir 对计数也表了态,这一点对做搜索界面的人很关键。项目称分面计数“默认就是精确的”,结果总数在请求要求时精确,不要求时就剪枝。查询、分面和指标在同一个索引视图上跑同一遍,所以一次往返就能同时返回文档、侧边栏计数和页头数字。
两篇文章讲的都是大多数用户看不到的管道。但搜索的经济账恰恰是在这一层被决定,而这笔账正在快速变化。
一个读结构、不读词汇的检测器
Luxir 上线同一天,arXiv 上的一篇论文把矛头指向了填满这些索引的内容。《SlopShape: Identifying AI-Generated Commercial Web Content》于 9月14日提交、9月17日修订,要问的是:能不能靠结构特征识别 AI 生成的文本,也就是信息以什么方式呈现、按什么顺序、拿什么作证据、用什么口吻。作者是 Sitefire 的 Jochen Madler,他复现了 Russell 等人针对商业内容的 StoryScope 工作:268 个公司域名下的 2250 篇 ChatGPT 之前的人类博客文章,对照来自五个前沿模型的 11250 篇 AI 镜像文章。一套 214 个特征的测量工具由 LLM 执行,并在人工金标注环节验证,人与人的 kappa 为 0.928,人与模型的 kappa 为 0.946;仅凭 187 个结构特征,它在留出公司上的宏 F1 就达到 98.0。把每篇 AI 文章用它自己的模型改写一遍,分数仍是 98.1。
论文还声称能做归属判断。AI 文章共享“一种整齐、自我宣告的形状”,79.3% 被归到正确的源模型,而随机猜的概率是 16.7%,人类文章则占据少见的结构配置。流水线、测量工具、提示词和代码都已公开。
这个结果对搜索很重要,因为结构恰恰是排序系统和 AI 答案引擎消费的东西。如果商业网页内容有一种可检测的形状,那么搜索引擎索引的语料正变得越来越统一,而索引它的工具同时变得更快、更便宜。
买单的是出版商
材料里周边的标题指向的却是另一个方向。材料援引的近期报道包括:9月24日的一篇报道称,出版商的 Google 搜索流量同比降幅扩大到 40%;9月16日的一条消息说,Google 搜索资料徽章暴露了出版商的流量危机。更早的条目则描述全网搜索引擎流量下滑,一些小网站跌幅达 60%,以及 Google AI 搜索威胁小出版商,因为对话式 AI 切走了网站流量。其中一些日期不在上一周内,所以它们是背景而不是新闻。但它们为上面这些技术发布定下了基调:建搜索索引的成本一直在降,而索引返还给出版商的流量也跟着一直在降。
材料里另外两条说明了这个领域已经有多宽。9月26日,CleanTechnica 为其自有图书出版业务开放投稿,给作者一条出版路径:先付 3000 到 5000 美元,再加每本书销售的分成,并定于 9月30日开一场 Google Hangout。9月24日,Wiley 的工程内容中心发布了一份由 Hendrix by Marmon Utility 赞助的白皮书,讲变电站出线施工,认为出站头几档线路的可靠性格外重要,因为那里一处接触引发的故障可能同时中断多条回路。
这两条表面上看都不是搜索新闻。但它们都是针对特定受众的商业内容,以赞助商名义或出版商品牌生产,而这正是 SlopShape 论文试图分类的同一类东西。论文的说法是,这类内容有一种形状:特定的顺序、特定类型的证据、特定的口吻。如果这成立,下一代搜索引擎就得决定拿它怎么办。
眼下,基础设施这一侧跑得比政策这一侧快。PlanetScale 正在发布 TIN,也就是它面向 Postgres 的全文搜索索引,并表示会有一篇更深入的文章讲它的功能、性能和实现。Luxir 可以下载,HTTP/JSON API 跑在 9400 端口,用数据目录做持久化。arXiv 上的论文是公开的,附有代码和产物。
它们都没有解决的是读者去哪里。搜索引擎越来越会找文档,而出版商报告说,到达他们那里的人越来越少。这个缺口,正是这套工具还没回答的问题。
资料来源
5- 01Anatomy of a (Postgres) Search EngineEN
- 02Luxir: Open-source hybrid search engineEN
- 03SlopShape: Identifying AI-Generated Commercial Web ContentEN
- 04Publish Your Book Through CleanTechnica PressEN
- 05Engineering the Substation Exit for Reliability, Capacity, and ExpansionEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。