Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

I volontari addestrano un modello linguistico da 145M di parametri senza server e senza fondi

Un progetto di volontariato chiamato Coop ha messo online il 30 settembre il modello della seconda fase: un modello linguistico da 145M di parametri preaddestrato interamente su hardware di consumo donato e su livelli cloud gratuiti.

IA e modelliNotiziaChiara RomanoPubblicato: 1 ottobre 20263 min di letturaFonti 5
I volontari addestrano un modello linguistico da 145M di parametri senza server e senza fondi

Il repository, ospitato su GitHub alla voce commonsense-ai/coop, spiega che l'intero ciclo di addestramento gira senza un server, senza un demone e senza alcun finanziamento. I worker scaricano il checkpoint corrente da un repo di modelli su Hugging Face, eseguono passi AdamW in locale su una porzione personale di dati e inviano uno pseudo-gradiente come pull request su un repo pubblico di dataset su Hugging Face. Un cron job di GitHub Actions, programmato ogni cinque minuti, aggrega quello che è arrivato, esegue un passo esterno di Nesterov e carica un nuovo checkpoint.

La fase 2 è un transformer solo decoder con 12 layer, 14 teste, d=896 e una finestra di contesto da 1.024 token, addestrato su FineWeb-Edu.

La fase 1, un modello da 15M di parametri addestrato per sei giorni su TinyStories, si è chiusa oltre il budget ottimale di Chinchilla, con la validation loss scesa da 9,01 a 2,8. Lo riporta il README del progetto stesso.

Cosa hanno dimostrato davvero i volontari

Il README è insolitamente preciso sui modi in cui il sistema fallisce, ed è qui che stanno i dettagli ingegneristici. Un invio che ha fatto gara con un tick di aggregazione è stato accettato un passo più tardi, con un peso di staleness ridotto. Le ripetizioni di un singolo utente si sono fuse in un solo voto, cosa che il progetto descrive come una difesa dal farming di token. Un comando coop stop ha svuotato un round a metà invece di scartarlo. La casella in ingresso si svuota a ogni tick. Più volontari su Apple Silicon e su semplici CPU hanno addestrato lo stesso passo esterno, che poi è stato mediato in un unico aggiornamento.

I contributori non hanno bisogno di permessi. Qualsiasi account gratuito su Hugging Face con un write token può aprire un invio, e il maintainer non concede accessi speciali.

Pesi e stato dell'ottimizzatore vivono solo su Hugging Face in formato safetensors, mentre Git tiene codice, configurazione e un registro dei contributori su un ramo dedicato.

Il progetto è anche attento a cosa significano i suoi numeri. Ogni tick valuta il nuovo checkpoint su una fetta fissa di dati tenuti da parte con un seed fisso, così un cambiamento tra un passo e l'altro riflette il modello e non il campionamento. La classifica calcola una pendenza sulla validation loss rispetto ai token, non ai passi esterni, perché un passo è quanto lavoro è capitato di ricevere in quel tick. Il README afferma che una discesa significa che la pendenza supera due errori standard; qualsiasi valore inferiore viene riportato come tale.

Dove si colloca rispetto al resto del settore

Il lavoro sui modelli piccoli è affollato. TechCrunch ha riportato il 30 settembre che Google ha rilasciato Gemini 4 Argon a un gruppo selezionato di partner della sicurezza informatica attraverso il suo Fairwind Program, un modello di frontiera più che un modello piccolo. CNBC ha riportato lo stesso giorno che Argon è già usato internamente per ottimizzare la memoria nei data center di Google. Il contrasto è il punto: i 145M di parametri di Coop sono circa tre ordini di grandezza sotto un rilascio di frontiera, e girano su hardware che i volontari già possiedono.

Il progetto non è l'unico sforzo in quella direzione, anche se il dossier sostiene direttamente solo le affermazioni di Coop.

Quello che mostra è un meccanismo di addestramento distribuito funzionante senza un budget per infrastruttura centrale. Il README dice che il ciclo è provato in produzione più che progettato, ed elenca i casi limite specifici che ha superato.

Coop distribuisce una CLI installabile tramite uv, e un comando coop run latest scarica il checkpoint corrente e genera testo da un prompt.

Il progetto consiglia invece di eseguire il modello TinyStories della fase 1 completata, definendolo molto più coerente di una run ancora in corso.

Commenti 0

Fonti

5
  1. 01Coop: A small language model pretrained by volunteersEN
  2. 02Google releases Gemini 4 Argon, called its most powerful model yetEN
  3. 03Google rolls out Gemini 4 Argon, its most advanced AI modelEN
  4. 04OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
  5. 05OpenAI announces 'dots' agent after scrapping launch of new AI model over safety concernsEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.