Il modello da 145M parametri di Coop e la spinta verso i modelli piccoli
Un modello linguistico da 145 di parametri sta facendo pretraining da zero su hardware consumer donato, senza server né finanziamenti, secondo il repository GitHub del progetto aggiornato il 30 settembre.

Il progetto si chiama Coop. Il suo repository descrive un ciclo di addestramento che gira interamente su macchine volontarie, sfruttando i livelli gratuiti di Hugging Face e GitHub Actions.
La fase 2 è attiva: un modello da circa 145M parametri sta facendo pretraining su FineWeb-Edu. La fase 1, un run da 15M parametri su TinyStories, ha superato il budget di token ottimale Chinchilla. I volontari scaricano un checkpoint, eseguono alcuni step locali AdamW su uno sharding dei dati personali e inviano una pseudo-gradiente come pull request contro un repository di dataset pubblici su Hugging Face. Un cron job di GitHub Actions, schedulato ogni cinque minuti, legge le pull request aperte, scarta quelle vecchie, clippa e filtra le restanti, le aggrega con una media ritagliata o una mediana geometrica, esegue un passo Nesterov e carica un nuovo checkpoint. Il repository specifica che lo scheduler condiviso di GitHub attiva effettivamente tra pochi minuti e alcune ore di distanza, e che il protocollo tollera qualsiasi frequenza.
Il progetto afferma che il suo ciclo è provato in produzione, non solo progettato. Più volontari, su Apple Silicon e CPU standard, hanno addestrato lo stesso step esterno e ne hanno ottenuto la media in un unico aggiornamento. Una submission che ha perso la corsa a un tick è stata accettata un passo dopo con peso di stanchezza ridotto, i round ripetuti da un utente sono stati fusi in un singolo voto e un round incompleto è stato flushato invece di essere scartato.
Questo conta perché l'estremità piccola del mercato si sta affollando. Il 2 ottobre, Microsoft AI ha rilasciato MAI-Transcribe-2-Streaming, un modello di trascrizione in tempo reale che copre 60 lingue e restituisce i primi risultati parziali in appena oltre 100 millisecondi, come riportato da The Decoder. Lo stesso rilascio includeva MAI-Voice-2.1, che parla 23 lingue con una sola voce, e una variante Flash con latenza di 150 millisecondi e costo di $15 per milione di caratteri, in calo da $22.
I modelli decisionali sono l'altra frontiera. AWS ha rilasciato Strands Decider 2B, un modello open source che restituisce scelte calibrate invece di testo, costruito sulla base di Qwen3.5-2B, come riportato da TechCrunch il 1 ottobre. Marc Brooker, ingegnere distinto di Amazon, ha detto a TechCrunch che questa classe di modelli è "un decider perfetto per un passo di workflow". TypeSafe, che ha chiamato il suo modello Jev in onore dell'economista William Stanley Jevons, sta lavorando a versioni future; il CEO Diogo Almeida ha dichiarato a TechCrunch di non vedere ancora una vera concorrenza emergere.
L'hardware è il vincolo. Apple ora include un Foundation Model sui Mac con chip M1 o più recente, raggiungibile dal terminale con il comando fm una volta configurato Apple Intelligence, come riportato da t3n il 2 ottobre. Il modello risponde localmente e non porta il contesto tra i prompt.
La ricerca sta indagando dove questi sistemi si rompono. Un paper sottomesso il 29 settembre traccia i loop di retry negli agenti di modelli linguistici di diffusione, attribuendoli al masked decoding e proponendo una regola di scoring inverso senza addestramento chiamata Reflect Reverse, secondo l'abstract su arXiv. Un altro paper, sottomesso il 1 ottobre, riporta che le classifiche dei modelli si invertono tra diversi harness di agenti: su Terminal-Bench 4, Claude guida GPT di 7.94 punti in OpenHands ma è dietro di 30.16 punti in PI, su 66 configurazioni valutate, scrivono gli autori.
La scacchi è il nuovo banco di prova economico per l'ottimizzazione dei prompt, con 1,118 puzzle Lichess e un costo di studio totale di circa $800, secondo un paper sottomesso il 30 settembre. Il modello più forte valutato, Gemini 3.5 Flash, usato come meta-modello, risolve solo circa il 55% dei puzzle. Altrove, un controller di memoria basato su rank ha ridotto i token dei prompt del 5.9% e abbassato l'errore di predizione della coda della metà inferiore del 13.6% rispetto a una baseline di memoria a grafo su Synthetic Graph World, con una riduzione dei token del 24.48% su LongMemEval a parità di accuratezza, secondo i suoi autori.
Coop si trova all'estremità opposta di quella curva: nessun datacenter, nessuna riga di budget, una leaderboard adattata sulla loss di validazione rispetto ai token anziché agli step esterni. Il repository nota che una singola loss di validazione non dice nulla, perché gli step esterni la spostano su tanto quanto giù. La direzione è una proprietà della serie.
Fonti
8- 01Coop: A small language model pretrained by volunteersEN
- 02Microsoft AI releases new transcription and text-to-speech models for voice agentsEN
- 03Amazon releases its own Jev clone as decision models flood the webEN
- 04Versteckter KI-Chatbot auf dem Mac: So greifst du auf Apples lokales Modell zuDE
- 05Does This Action Still Explain the Task? Reverse Scoring for Diffusion Language Model AgentsEN
- 06Finding the Right Fit: Model-Harness Interactions across Agent TasksEN
- 07Benchmarking Prompt Optimization of Large Language Models With ChessEN
- 08Heavy-Tailed Memory Traces in Long-Horizon Language AgentsEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.