Otwarte wagi wciąż wychodzą: Inspect, Phonon-2, Kumo Tabular i ochotniczy model 145M
Brytyjski Instytut Bezpieczeństwa AI i Meridian Labs opublikowały 30 września Inspect, otwartoźródłowe narzędzie z ponad 200 gotowymi ewaluacjami. To kolejna z serii otwartych premier, obok modelu mowy Phonon-2 od Fermion Research i Kumo Tabular od Nvidii.

Premiera odbyła się 30 września o 15:20 UTC, jak podaje strona projektu. Inspect to narzędzie do ewaluacji modeli frontier, zbudowane przez brytyjski Instytut Bezpieczeństwa AI i Meridian Labs. Jego atutem jest szerokość: kodowanie, zadania agentowe, rozumowanie, wiedza, zachowanie i rozumienie multimodalne, wszystko w jednym miejscu.
W zestawie są komponowalne zbiory danych, agenci, narzędzia i oceniające, a do tego biblioteka ponad 200 gotowych ewaluacji. Dostępne są przeglądarkowe narzędzie Inspect View i rozszerzenie do VS Code. Piaskownica uruchamia niezaufany kod modelu w Dockerze, Kubernetesie, Modalu, Proxmoksie albo Vagrancie przez API rozszerzeń. Projekt deklaruje wsparcie dla ponad 20 dostawców modeli, w tym lokalnego wnioskowania z HuggingFace, vLLM i SGLang.
Narzędzia do ewaluacji to ta mniej efektowna połowa otwartych wag. Wagi bez sposobu na ich zmierzenie są tylko plikami.
Model mowy o rozmiarze 164 MB i model tabelaryczny, który nie wymaga treningu
Fermion Research wydało Phonon-2 30 września i nazywa go najdokładniejszym otwartym modelem rozpoznawania mowy poniżej 900 MB. Do pobrania jest 164 MB. Firma podaje, że średni błąd na poziomie słowa wynosi 5,21 procent na siedmiu angielskich zestawach z Open ASR Leaderboard i że każdy otwarty model z lepszym wynikiem jest co najmniej 5,8 razy większy.
Koder zapisuje każdą wagę jako jeden z pięciu wyuczonych poziomów, około 2,1 bita, upakowanych jako cyfry trójkowe, pięć na bajt. Wagi są na licencji CC-BY-4.0, tej samej co Nvidia Parakeet TDT 0.6B v3, z którego pochodzą. Fermion twierdzi, że godzina dźwięku zamienia się w tekst w około 20 sekund na MacBooku Air, a na H100 w partiach po 128 to 13 sekund na dobę dźwięku.
Wkład Nvidii to inny rodzaj kompresji. Kumo Tabular, opublikowany na Hugging Face 29 września, przewiduje etykiety z oznaczonej tabeli w jednym przejściu w przód, bez treningu, bez dostrajania i bez inżynierii cech, zarówno dla klasyfikacji, jak i regresji. Występuje w trzech rozmiarach od 28M do 215M parametrów, był wstępnie trenowany wyłącznie na danych sztucznych i jest wydany na licencji OpenMDW-1.1 do użytku komercyjnego. Nvidia podaje, że zajmuje pierwsze miejsce na TabArena, BeyondArena, TALENT i ScoringBench.
Ochotnicy, Rust i model 145M trenowany na zadaniach cron
Mniejsze przedsięwzięcia też się ruszają. Coop, projekt na GitHubie zaktualizowany 30 września, wstępnie trenuje transformer typu decoder-only o około 145M parametrów na FineWeb-Edu. Korzysta z użyczonego sprzętu konsumenckiego i darmowych planów Hugging Face oraz GitHub Actions. Pseudogradienty przychodzą jako pull requesty do publicznego repozytorium zbioru danych. Bezstanowy cron GitHub Actions scala je zewnętrznym krokiem w stylu DiLoCo teoretycznie co pięć minut, choć projekt zaznacza, że harmonogram GitHuba odpala się w odstępach od minut do godzin. Etap 1, model 15M na TinyStories, przekroczył swój optymalny budżet Chinchilli w sześć dni i zbił stratę walidacyjną z 9,01 do 2,8.
Osobno projekt w Ruście o nazwie PSSA, również zaktualizowany 30 września, opisuje architekturę inną niż transformer. Ma selektywną rekurencję przestrzeni stanów, bank pamięci epizodycznej i aktualizacje wag na token. Autor twierdzi, że uczy się szybciej niż transformer przy tych samych parametrach i generuje około dwanaście razy szybciej na tym samym procesorze. W repozytorium nie ma niezależnego benchmarku.
Otwarte premiery z tego tygodnia przypadają na trudniejszy grunt regulacyjny. The Guardian poinformował 30 września, że FTC wszczęła branżowe dochodzenie wobec Anthropic, OpenAI i innych. To pierwsze oficjalne działanie egzekucyjne w USA dotyczące samowolnych agentów AI. Ars Technica podała tego samego dnia, że OpenAI opóźnia swoje IPO z powodu obaw o bezpieczeństwo. Otwarte wagi nie są przedmiotem żadnego z tych działań, ale ta wnikliwość ustawia ton dla wszystkiego, co wychodzi obok nich.
Źródła
7- 01Inspect: An open-source framework for large language model evaluationsEN
- 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 03Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 04Coop: A small language model pretrained by volunteersEN
- 05PSSA: A non-transformer language model written from scratch in RustEN
- 06US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
- 07OpenAI delays IPO over AI safety concernsEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.