Postgres, Luxir i SlopShape: stos wyszukiwania przebudowany, ruch wydawców spada
27 września PlanetScale opublikował techniczny przewodnik po wyszukiwaniu pełnotekstowym w Postgresie. To najnowsza pozycja w tygodniu premier infrastruktury wyszukiwania, który wypada w momencie, gdy wydawcy raportują gwałtowne spadki ruchu z wyszukiwarek.

Najnowsza zmiana w stosie wyszukiwania nie przyszła w tym tygodniu od żadnej wyszukiwarki. 27 września PlanetScale opublikował tekst "Anatomy of a (Postgres) Search Engine", przewodnik po tym, jak działają indeksy odwrócone w Postgresie i czym różnią się od b-drzew, po które programiści sięgają najpierw.
Tekst PlanetScale przypomina, że wyszukiwanie jest dziś funkcją bazy danych, a nie tylko kategorią produktu. "B-drzewo jest bezużyteczne przy dopasowywaniu treści w środku łańcucha znaków", pisze firma, po czym pokazuje wzorzec, którego programiści mają przestać używać: zapytanie sprawdzające każdy wiersz tabeli przez LIKE z wildcardem na początku. Alternatywą jest indeks odwrócony, kluczowany po każdym słowie w polu, i właśnie tak działają "zasadniczo wszystkie wyszukiwarki pełnotekstowe", czytamy we wpisie. To drobny szczegół architektury, ale ma duże skutki dla tego, jak szybko baza odpowiada na pytanie. Przewodnik wyjątkowo konkretnie opisuje mechanizm. Indeks odwrócony ma słownik terminów i listy wystąpień, do których może dołożyć dane o pozycji i częstotliwości. Listy wystąpień są posortowane, a potem kompresowane: PlanetScale podaje przykład indeksu z 300 000 dokumentów, z których 100 000 zawiera słowo "who". Zapisanie każdego ID dosłownie zajęłoby 19 bitów na wystąpienie, ale średni odstęp między kolejnymi ID wynosi trzy, co mieści się w dwóch bitach. Gęste listy mogą pójść dalej i przechowywać bitmapę, która staje się optymalna, gdy około połowa wszystkich dokumentów zawiera dany termin. To szczegół kompresji, ale wyjaśnia, dlaczego wyszukiwanie po dużych zbiorach jest w ogóle opłacalne i dlaczego silnik zapytań potrafi wyznaczyć sumę lub część wspólną dwóch list wystąpień w jednym przejściu O(n). PlanetScale zauważa też, że instrukcje wektorowe w nowszych procesorach potrafią wykonać OR lub AND na 128, 256, a nawet 512 bitach w jednej instrukcji, gdy listy są zapisane jako bitmapy.
Luxir reklamuje wyszukiwanie pełnego spektrum w jednym silniku
Pięć dni wcześniej, 22 września, osobny projekt o nazwie Luxir opublikował własną propozycję: otwarty silnik, który łączy wyszukiwanie pełnotekstowe, wektorowe i fasetowe z analityką w jednym zapytaniu. Strona Luxira stawia sprawę w kategoriach kosztu, nie funkcji. Silnik jest "zaprojektowany tak, by dawać najwięcej wyszukiwania na rdzeń, na gigabajt i na dolara", a klienci chmury "płacą za nieefektywność bez końca".
Twierdzenia o architekturze są konkretne. Harmonogram z podbieraniem pracy rozkłada indeksowanie, scalanie i wykonywanie zapytań na rdzenie, a wejście i wyjście sieciowe jest asynchroniczne, więc wolny klient nie blokuje rdzenia. Segmenty są niezmienne i mapowane w pamięć, więc czyta się je z pamięci podręcznej stron. Dekodowanie list wystąpień, punktowanie i odległość wektorowa idą ścieżkami SIMD, z przycinaniem block-max dla zapytań o top-k. Luxir zajmuje też stanowisko w sprawie liczników, które ma znaczenie dla każdego, kto buduje interfejs wyszukiwania. Liczniki faset są "domyślnie zawsze dokładne", podaje projekt, a łączna liczba wyników jest dokładna, gdy zapytanie o to poprosi, i przycinana, gdy nie. Zapytania, fasety i metryki liczą się w tym samym przejściu po tym samym widoku indeksu, więc jedno okrążenie zwraca razem dokumenty, liczby z panelu bocznego i liczby w nagłówku.
Oba wpisy opisują instalację, której większość użytkowników nigdy nie widzi. To jednak warstwa, w której rozstrzyga się ekonomia wyszukiwania, a ta zmienia się szybko.
Detektor, który czyta strukturę, nie słownictwo
W dniu premiery Luxira praca na arXiv wzięła na cel treść, która zapełnia te indeksy. "SlopShape: Identifying AI-Generated Commercial Web Content", złożona 14 września i poprawiona 17 września, pyta, czy tekst wygenerowany przez AI da się rozpoznać po sygnaturach strukturalnych, czyli po tym, jak informacja jest podana, w jakiej kolejności, z jakim dowodem i jakim głosem. Autor, Jochen Madler z Sitefire, powtórzył pracę StoryScope Russella i współpracowników na treści komercyjnej: 2 250 ludzkich wpisów blogowych sprzed ChatGPT z 268 domen firmowych zestawił z 11 250 odpowiednikami z pięciu modeli frontier. Narzędzie o 214 cechach, zastosowane przez LLM i zwalidowane w sesji złotej anotacji, w której zgodność człowiek-człowiek wyniosła kappa 0,928, a człowiek-model 0,946, wykryło wpisy AI na podstawie samych 187 cech strukturalnych z wynikiem 98,0 macro-F1 na firmach spoza zbioru treningowego. Przeformułowanie każdego wpisu AI jego własnym modelem nie zmieniło wyniku: 98,1.
Praca twierdzi też, że potrafi przypisać autorstwo. Wpisy AI mają "schludny, samoogłaszający się kształt", 79,3 procent przypisano do właściwego modelu źródłowego przy losowym trafieniu 16,7 procent, a wpisy ludzkie zajmują rzadkie konfiguracje strukturalne. Potok, narzędzie, prompty i kod są udostępnione.
Ten wynik ma znaczenie dla wyszukiwania, bo struktura to dokładnie to, co konsumują systemy rankingowe i silniki odpowiedzi oparte na AI. Jeśli komercyjna treść w sieci ma wykrywalny kształt, to zbiór, który indeksują wyszukiwarki, ujednolica się w tym samym czasie, gdy narzędzia do indeksowania stają się szybsze i tańsze.
Płacą za to wydawcy
Nagłówki wokół dossier wskazują na coś przeciwnego. Wśród ostatnich materiałów cytowanych w dossier jest raport, że spadek w wyszukiwarce Google dla wydawców pogłębił się do 40 procent rok do roku, z 24 września, oraz osobna pozycja, że Profile Badges w wyszukiwarce Google obnażają kryzys ruchu wydawców, z 16 września. Starsze materiały mówią o spadku ruchu z wyszukiwarek w całej sieci, przy czym niektóre małe strony odnotowały spadek o 60 procent, a wyszukiwanie AI w Google zagraża małym wydawcom, bo konwersacyjne AI odcina ruch na stronach. Część tych dat wypada poza ostatni tydzień, więc to tło, nie bieżące wiadomości. Wyznaczają jednak ramę dla opisanych wyżej premier technicznych: koszt zbudowania indeksu wyszukiwania stale spada, a ruch, który ten indeks odsyła wydawcom, spada razem z nim.
Dwie inne pozycje z dossier pokazują, jak szerokie stało się to pole. 26 września CleanTechnica otworzyła nabór do własnego ramienia wydawniczego, oferując autorom drogę do publikacji za opłatą z góry od 3 000 do 5 000 dolarów plus procent od każdej sprzedanej książki, z Google Hangout zaplanowanym na 30 września. 24 września centrum treści inżynieryjnych Wileya opublikowało białą księgę, sponsorowaną przez Hendrix by Marmon Utility, o budowie wyjść z podstacji. Autorzy przekonują, że niezawodność na pierwszych przęsłach wychodzących ze stacji ma nietypową wagę, bo pojedyncze uszkodzenie stykowe w tym miejscu może przerwać wiele obwodów naraz.
Żadna z tych pozycji nie jest z pozoru historią o wyszukiwaniu. Obie to jednak treść komercyjna skierowana do konkretnego odbiorcy, powstała pod nazwą sponsora albo marką wydawcy, a to ta sama kategoria, którą próbuje klasyfikować praca SlopShape. Teza pracy jest taka, że taka treść ma kształt: określony porządek, określony rodzaj dowodu, określony głos. Jeśli to się utrzyma, następna generacja wyszukiwarek będzie musiała zdecydować, co z tym zrobić.
Na razie strona infrastruktury rusza się szybciej niż strona polityki. PlanetScale udostępnia TIN, swój indeks wyszukiwania pełnotekstowego dla Postgresa, i zapowiada obszerniejszy artykuł o jego funkcjach, wydajności i implementacji. Luxir można pobrać, ma API HTTP/JSON na porcie 9400 i katalog danych do przechowywania. Praca na arXiv jest publiczna, z dołączonym kodem i artefaktami.
Żadna z nich nie rozstrzyga, dokąd idą czytelnicy. Wyszukiwarki coraz lepiej znajdują dokumenty, a wydawcy raportują, że dociera do nich coraz mniej osób. Ta luka to historia, na którą narzędzia jeszcze nie odpowiedziały.
Źródła
5- 01Anatomy of a (Postgres) Search EngineEN
- 02Luxir: Open-source hybrid search engineEN
- 03SlopShape: Identifying AI-Generated Commercial Web ContentEN
- 04Publish Your Book Through CleanTechnica PressEN
- 05Engineering the Substation Exit for Reliability, Capacity, and ExpansionEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.