Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Otwarte wagi wciąż wychodzą: Inspect, Phonon-2, Kumo Tabular i ochotniczy model 145M

Brytyjski Instytut Bezpieczeństwa AI i Meridian Labs opublikowały 30 września Inspect, otwartoźródłowe narzędzie z ponad 200 gotowymi ewaluacjami. To kolejna z serii otwartych premier, obok modelu mowy Phonon-2 od Fermion Research i Kumo Tabular od Nvidii.

AI i modeleAnalizaMarta ZielińskaOpublikowano: 30 września 20263 min czytaniaŹródła 7
Otwarte wagi wciąż wychodzą: Inspect, Phonon-2, Kumo Tabular i ochotniczy model 145M

Premiera odbyła się 30 września o 15:20 UTC, jak podaje strona projektu. Inspect to narzędzie do ewaluacji modeli frontier, zbudowane przez brytyjski Instytut Bezpieczeństwa AI i Meridian Labs. Jego atutem jest szerokość: kodowanie, zadania agentowe, rozumowanie, wiedza, zachowanie i rozumienie multimodalne, wszystko w jednym miejscu.

W zestawie są komponowalne zbiory danych, agenci, narzędzia i oceniające, a do tego biblioteka ponad 200 gotowych ewaluacji. Dostępne są przeglądarkowe narzędzie Inspect View i rozszerzenie do VS Code. Piaskownica uruchamia niezaufany kod modelu w Dockerze, Kubernetesie, Modalu, Proxmoksie albo Vagrancie przez API rozszerzeń. Projekt deklaruje wsparcie dla ponad 20 dostawców modeli, w tym lokalnego wnioskowania z HuggingFace, vLLM i SGLang.

Narzędzia do ewaluacji to ta mniej efektowna połowa otwartych wag. Wagi bez sposobu na ich zmierzenie są tylko plikami.

Model mowy o rozmiarze 164 MB i model tabelaryczny, który nie wymaga treningu

Fermion Research wydało Phonon-2 30 września i nazywa go najdokładniejszym otwartym modelem rozpoznawania mowy poniżej 900 MB. Do pobrania jest 164 MB. Firma podaje, że średni błąd na poziomie słowa wynosi 5,21 procent na siedmiu angielskich zestawach z Open ASR Leaderboard i że każdy otwarty model z lepszym wynikiem jest co najmniej 5,8 razy większy.

Koder zapisuje każdą wagę jako jeden z pięciu wyuczonych poziomów, około 2,1 bita, upakowanych jako cyfry trójkowe, pięć na bajt. Wagi są na licencji CC-BY-4.0, tej samej co Nvidia Parakeet TDT 0.6B v3, z którego pochodzą. Fermion twierdzi, że godzina dźwięku zamienia się w tekst w około 20 sekund na MacBooku Air, a na H100 w partiach po 128 to 13 sekund na dobę dźwięku.

Wkład Nvidii to inny rodzaj kompresji. Kumo Tabular, opublikowany na Hugging Face 29 września, przewiduje etykiety z oznaczonej tabeli w jednym przejściu w przód, bez treningu, bez dostrajania i bez inżynierii cech, zarówno dla klasyfikacji, jak i regresji. Występuje w trzech rozmiarach od 28M do 215M parametrów, był wstępnie trenowany wyłącznie na danych sztucznych i jest wydany na licencji OpenMDW-1.1 do użytku komercyjnego. Nvidia podaje, że zajmuje pierwsze miejsce na TabArena, BeyondArena, TALENT i ScoringBench.

Ochotnicy, Rust i model 145M trenowany na zadaniach cron

Mniejsze przedsięwzięcia też się ruszają. Coop, projekt na GitHubie zaktualizowany 30 września, wstępnie trenuje transformer typu decoder-only o około 145M parametrów na FineWeb-Edu. Korzysta z użyczonego sprzętu konsumenckiego i darmowych planów Hugging Face oraz GitHub Actions. Pseudogradienty przychodzą jako pull requesty do publicznego repozytorium zbioru danych. Bezstanowy cron GitHub Actions scala je zewnętrznym krokiem w stylu DiLoCo teoretycznie co pięć minut, choć projekt zaznacza, że harmonogram GitHuba odpala się w odstępach od minut do godzin. Etap 1, model 15M na TinyStories, przekroczył swój optymalny budżet Chinchilli w sześć dni i zbił stratę walidacyjną z 9,01 do 2,8.

Osobno projekt w Ruście o nazwie PSSA, również zaktualizowany 30 września, opisuje architekturę inną niż transformer. Ma selektywną rekurencję przestrzeni stanów, bank pamięci epizodycznej i aktualizacje wag na token. Autor twierdzi, że uczy się szybciej niż transformer przy tych samych parametrach i generuje około dwanaście razy szybciej na tym samym procesorze. W repozytorium nie ma niezależnego benchmarku.

Otwarte premiery z tego tygodnia przypadają na trudniejszy grunt regulacyjny. The Guardian poinformował 30 września, że FTC wszczęła branżowe dochodzenie wobec Anthropic, OpenAI i innych. To pierwsze oficjalne działanie egzekucyjne w USA dotyczące samowolnych agentów AI. Ars Technica podała tego samego dnia, że OpenAI opóźnia swoje IPO z powodu obaw o bezpieczeństwo. Otwarte wagi nie są przedmiotem żadnego z tych działań, ale ta wnikliwość ustawia ton dla wszystkiego, co wychodzi obok nich.

Komentarze 0

Źródła

7
  1. 01Inspect: An open-source framework for large language model evaluationsEN
  2. 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  3. 03Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  4. 04Coop: A small language model pretrained by volunteersEN
  5. 05PSSA: A non-transformer language model written from scratch in RustEN
  6. 06US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
  7. 07OpenAI delays IPO over AI safety concernsEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Marta Zielińska

Marta Zielińska

AI, modele i technologie

Marta Zielińska pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, preprintach i danych z API, a nie na zapowiedziach producentów. Przy każdej publikacji sprawdza karty modeli, parametry treningowe i benchmarki, a liczby porównuje z niezależnymi testami i wynikami z repozytoriów. Rozmawia z badaczami i inżynierami, czeka na kolejne wydania modeli i zestawia ich działanie z wcześniejszymi wersjami. Prywatnie drukuje w 3D, naprawia stare komputery i sprawdza, jak modele uczą się na śmieciach z internetu. Nie publikuje wyników, których nie może odtworzyć na własnym sprzęcie.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.