Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Wolontariusze wytrenowali model językowy o 145M parametrów bez serwerów i bez finansowania

Projekt społecznościowy Coop uruchomił 30 września model drugiego etapu: 145M parametrów, wstępnie wytrenowany w całości na użyczonym sprzęcie konsumenckim i darmowych warstwach chmurowych.

AI i modeleNewsMarta ZielińskaOpublikowano: 1 października 20263 min czytaniaŹródła 5
Wolontariusze wytrenowali model językowy o 145M parametrów bez serwerów i bez finansowania

Repozytorium projektu stoi na GitHubie pod adresem commonsense-ai/coop. Cała pętla treningowa działa bez serwera, bez demona i bez żadnego finansowania. Workery pobierają bieżący checkpoint z repozytorium modelu na Hugging Face, wykonują lokalne kroki AdamW na własnym wycinku danych i zgłaszają pseudogradient jako pull request do publicznego repozytorium zbioru danych na Hugging Face. Zadanie cron w GitHub Actions, uruchamiane co pięć minut, zbiera to, co napłynęło, wykonuje jeden zewnętrzny krok Nesterova i wgrywa nowy checkpoint.

Etap 2 to transformer wyłącznie dekoderowy: 12 warstw, 14 głowic, d=896 i kontekst 1 024 tokenów. Trenowano go na FineWeb-Edu.

Etap 1, model o 15M parametrów trenowany przez sześć dni na TinyStories, zakończył się powyżej optymalnego budżetu Chinchilli. Strata walidacyjna spadła z 9,01 do 2,8, jak podaje README projektu.

Co wolontariusze faktycznie udowodnili

README jest nietypowo konkretny, jeśli chodzi o tryby awarii, i właśnie tam siedzi szczegół inżynieryjny. Zgłoszenie, które ścigało się z taktem agregacji, zostało przyjęte o krok później, z obniżoną wagą nieaktualności. Powtórzone rundy od jednego użytkownika scalały się w jeden głos, co projekt opisuje jako zabezpieczenie przed farmieniem tokenów. Polecenie coop stop opróżniło niedokończoną rundę zamiast ją odrzucać. Skrzynka opróżnia się do zera przy każdym takcie. Kilku wolontariuszy na Apple Silicon i zwykłych procesorach wytrenowało ten sam zewnętrzny krok i uśredniło go w jedną aktualizację.

Współtwórcy nie potrzebują pozwolenia. Każde darmowe konto na Hugging Face z tokenem zapisu może otworzyć zgłoszenie, a opiekun nie przyznaje żadnego specjalnego dostępu.

Wagi i stan optymalizatora leżą wyłącznie na Hugging Face w formacie safetensors. Git trzyma kod, konfigurację i rejestr współtwórców na dedykowanej gałęzi.

Projekt uważa też na to, co znaczą jego liczby. Przy każdym takcie nowy checkpoint jest oceniany na stałym wycinku odłożonym na bok, z ustalonym ziarnem losowości, więc zmiana między krokami odzwierciedla model, a nie próbkowanie. Tabela wyników dopasowuje nachylenie straty walidacyjnej względem tokenów, nie zewnętrznych kroków, bo krok to tyle pracy, ile akurat się pojawiło w danym takcie. README podaje, że spadek oznacza, iż nachylenie przekracza dwa błędy standardowe; wszystko poniżej jest raportowane jako takie.

Jak wypada na tle reszty dziedziny

Praca nad małymi modelami jest zatłoczona. TechCrunch podał 30 września, że Google udostępnił Gemini 4 Argon wybranej grupie partnerów cyberbezpieczeństwa w ramach programu Fairwind. To model frontier, nie mały. CNBC podało tego samego dnia, że Argon jest już używany wewnętrznie do optymalizacji pamięci w centrach danych Google. Kontrast jest tu sednem: 145M parametrów Coopa to około trzy rzędy wielkości poniżej premiery frontier, a działa na sprzęcie, który wolontariusze już mają.

Projekt nie jest jedynym wysiłkiem w tym kierunku, choć dossier wspiera bezpośrednio tylko twierdzenia Coopa.

Pokazuje natomiast działający mechanizm rozproszonego treningu bez centralnego budżetu na infrastrukturę. README mówi, że pętla jest sprawdzona w produkcji, a nie zaprojektowana, i wymienia konkretne przypadki brzegowe, które przetrwała.

Coop dostarcza CLI instalowalne przez uv. Polecenie coop run latest pobiera bieżący checkpoint i generuje tekst z promptu.

Projekt zaleca jednak uruchomienie gotowego modelu z etapu 1 na TinyStories. Nazywa go znacznie bardziej spójnym niż przebieg wciąż w toku.

Komentarze 0

Źródła

5
  1. 01Coop: A small language model pretrained by volunteersEN
  2. 02Google releases Gemini 4 Argon, called its most powerful model yetEN
  3. 03Google rolls out Gemini 4 Argon, its most advanced AI modelEN
  4. 04OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
  5. 05OpenAI announces 'dots' agent after scrapping launch of new AI model over safety concernsEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Marta Zielińska

Marta Zielińska

AI, modele i technologie

Marta Zielińska pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, preprintach i danych z API, a nie na zapowiedziach producentów. Przy każdej publikacji sprawdza karty modeli, parametry treningowe i benchmarki, a liczby porównuje z niezależnymi testami i wynikami z repozytoriów. Rozmawia z badaczami i inżynierami, czeka na kolejne wydania modeli i zestawia ich działanie z wcześniejszymi wersjami. Prywatnie drukuje w 3D, naprawia stare komputery i sprawdza, jak modele uczą się na śmieciach z internetu. Nie publikuje wyników, których nie może odtworzyć na własnym sprzęcie.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.