跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

Postgres、Luxir 与 SlopShape:搜索技术栈正在重建,出版商流量却在下滑

9月27日,PlanetScale 发布了一篇关于 Postgres 全文搜索的深度技术解析。这是这一周搜索基础设施发布潮中最新的一个,而与此同时,出版商报告搜索引荐流量大幅下滑。

媒体与互联网分析王雅琴发布: 2026年9月28日6 分钟阅读资料来源 5
Postgres、Luxir 与 SlopShape:搜索技术栈正在重建,出版商流量却在下滑

这一周搜索技术栈的最新进展,不是来自搜索引擎。9月27日,PlanetScale 发布了《Anatomy of a (Postgres) Search Engine》,讲 Postgres 里的倒排索引怎么工作,以及它和大多数开发者最先想到的 b-tree 有什么不同。

PlanetScale 这篇文章提醒人们,搜索如今是数据库的一个功能,不只是一个产品品类。文章写道:“b-tree 无法匹配字符串中间的内容。”接着它展示了希望开发者别再用的写法:用前导通配符 LIKE 去逐行检查整张表。文章说,“几乎所有全文搜索引擎”都靠倒排索引定位文档,也就是按字段中每一个词单独建键。这是一个很小的架构点,却直接决定数据库回答一个问题能有多快。这篇解析对底层机制讲得异常具体。倒排索引有词项词典和倒排记录表,还可以额外加上位置和词频数据。倒排记录表先排序,再压缩:PlanetScale 举的例子是一份含 30 万篇文档的索引,其中 10 万篇包含 “who” 这个词。如果老老实实存每个 ID,每个倒排项要 19 位,但相邻 ID 之间的平均间隔是 3,两个位就够了。密集的表还能更进一步,直接存位图,当大约一半文档都含某个词时,位图就是最优选择。这只是压缩细节,却解释了为什么在大规模语料上做搜索还算便宜,也解释了为什么查询引擎能在一次 O(n) 扫描里取两个倒排记录表的并集或交集。PlanetScale 还提到,当表存成位图时,近年 CPU 上的向量指令一条就能对 128、256 甚至 512 位做 OR 或 AND。

Luxir 主张用一个引擎做全谱系搜索

五天前,也就是 9月22日,另一个叫 Luxir 的项目发布了自己的方案:一个开源引擎,在同一个请求里把全文搜索、向量搜索、分面搜索和分析结合起来。Luxir 的网站不从功能角度讲,而是从成本角度讲,称它“为每核、每 GB、每美元最多的搜索量而设计”,还说云客户“会永远为低效付费”。

架构上的说法很具体。工作窃取调度器把索引、合并和查询执行分摊到多个核上;网络 IO 是异步的,慢客户端不会占住一个核;段是不可变的、内存映射的,直接从页缓存里读。倒排项解码、打分和向量距离计算都走 SIMD 路径,top-k 请求用块最大值剪枝。Luxir 对计数也表了态,这一点对做搜索界面的人很关键。项目称分面计数“默认就是精确的”,结果总数在请求要求时精确,不要求时就剪枝。查询、分面和指标在同一个索引视图上跑同一遍,所以一次往返就能同时返回文档、侧边栏计数和页头数字。

两篇文章讲的都是大多数用户看不到的管道。但搜索的经济账恰恰是在这一层被决定,而这笔账正在快速变化。

一个读结构、不读词汇的检测器

Luxir 上线同一天,arXiv 上的一篇论文把矛头指向了填满这些索引的内容。《SlopShape: Identifying AI-Generated Commercial Web Content》于 9月14日提交、9月17日修订,要问的是:能不能靠结构特征识别 AI 生成的文本,也就是信息以什么方式呈现、按什么顺序、拿什么作证据、用什么口吻。作者是 Sitefire 的 Jochen Madler,他复现了 Russell 等人针对商业内容的 StoryScope 工作:268 个公司域名下的 2250 篇 ChatGPT 之前的人类博客文章,对照来自五个前沿模型的 11250 篇 AI 镜像文章。一套 214 个特征的测量工具由 LLM 执行,并在人工金标注环节验证,人与人的 kappa 为 0.928,人与模型的 kappa 为 0.946;仅凭 187 个结构特征,它在留出公司上的宏 F1 就达到 98.0。把每篇 AI 文章用它自己的模型改写一遍,分数仍是 98.1。

论文还声称能做归属判断。AI 文章共享“一种整齐、自我宣告的形状”,79.3% 被归到正确的源模型,而随机猜的概率是 16.7%,人类文章则占据少见的结构配置。流水线、测量工具、提示词和代码都已公开。

这个结果对搜索很重要,因为结构恰恰是排序系统和 AI 答案引擎消费的东西。如果商业网页内容有一种可检测的形状,那么搜索引擎索引的语料正变得越来越统一,而索引它的工具同时变得更快、更便宜。

买单的是出版商

材料里周边的标题指向的却是另一个方向。材料援引的近期报道包括:9月24日的一篇报道称,出版商的 Google 搜索流量同比降幅扩大到 40%;9月16日的一条消息说,Google 搜索资料徽章暴露了出版商的流量危机。更早的条目则描述全网搜索引擎流量下滑,一些小网站跌幅达 60%,以及 Google AI 搜索威胁小出版商,因为对话式 AI 切走了网站流量。其中一些日期不在上一周内,所以它们是背景而不是新闻。但它们为上面这些技术发布定下了基调:建搜索索引的成本一直在降,而索引返还给出版商的流量也跟着一直在降。

材料里另外两条说明了这个领域已经有多宽。9月26日,CleanTechnica 为其自有图书出版业务开放投稿,给作者一条出版路径:先付 3000 到 5000 美元,再加每本书销售的分成,并定于 9月30日开一场 Google Hangout。9月24日,Wiley 的工程内容中心发布了一份由 Hendrix by Marmon Utility 赞助的白皮书,讲变电站出线施工,认为出站头几档线路的可靠性格外重要,因为那里一处接触引发的故障可能同时中断多条回路。

这两条表面上看都不是搜索新闻。但它们都是针对特定受众的商业内容,以赞助商名义或出版商品牌生产,而这正是 SlopShape 论文试图分类的同一类东西。论文的说法是,这类内容有一种形状:特定的顺序、特定类型的证据、特定的口吻。如果这成立,下一代搜索引擎就得决定拿它怎么办。

眼下,基础设施这一侧跑得比政策这一侧快。PlanetScale 正在发布 TIN,也就是它面向 Postgres 的全文搜索索引,并表示会有一篇更深入的文章讲它的功能、性能和实现。Luxir 可以下载,HTTP/JSON API 跑在 9400 端口,用数据目录做持久化。arXiv 上的论文是公开的,附有代码和产物。

它们都没有解决的是读者去哪里。搜索引擎越来越会找文档,而出版商报告说,到达他们那里的人越来越少。这个缺口,正是这套工具还没回答的问题。

评论 0

资料来源

5
  1. 01Anatomy of a (Postgres) Search EngineEN
  2. 02Luxir: Open-source hybrid search engineEN
  3. 03SlopShape: Identifying AI-Generated Commercial Web ContentEN
  4. 04Publish Your Book Through CleanTechnica PressEN
  5. 05Engineering the Substation Exit for Reliability, Capacity, and ExpansionEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。