Coops 145M-Modell von Freiwilligen trainiert, und der Drang zu kleinen Modellen
Ein Sprachmodell mit 145 Parametern wird derzeit von Grund auf auf gespendeter Consumer-Hardware vorab trainiert, ohne Server und ohne Finanzierung, laut dem Projekt-GitHub-Repository, das am 30. September aktualisiert wurde.

Das Projekt heißt Coop. Sein Repository beschreibt eine Trainings-Schleife, die vollständig auf Freiwilligen-Maschinen sowie den kostenlosen Ebenen von Hugging Face und GitHub Actions läuft.
Stufe 2 ist live: ein Modell mit rund 145M Parametern wird auf FineWeb-Edu vorab trainiert. Stufe 1, ein Lauf mit 15M Parametern auf TinyStories, hat sein Chinchilla-optimales Token-Budget überschritten. Freiwillige laden einen Checkpoint herunter, führen eine Reihe lokaler AdamW-Schritte auf einem persönlichen Daten-Shard aus und senden einen Pseudo-Gradienten als Pull Request gegen ein öffentliches Hugging Face Dataset Repository. Ein GitHub Actions Cron Job, alle fünf Minuten geplant, liest die offenen Pull Requests, verwirft veraltete, schneidet und steuert die restlichen, aggregiert sie mit einem trimmed mean oder geometrischen Median, macht einen Nesterov-Schritt und lädt einen neuen Checkpoint hoch. Das Repository weist darauf hin, dass der geteilte Scheduler von GitHub tatsächlich alle paar Minuten bis Stunden feuert und dass das Protokoll jede Frequenz toleriert.
Das Projekt behauptet, seine Schleife sei produktionserprobt und nicht nur designed. Mehrere Freiwillige, auf Apple Silicon und einfacher CPU, haben denselben äußeren Schritt trainiert und ihn in ein Update einbezogen. Eine Einreichung, die mit einem Tick konkurrierte, wurde einen Schritt später mit reduzierte Veraltete-Gewichtung akzeptiert, wiederholte Runden eines Benutzers wurden in eine einzelne Stimme zusammengeführt, und eine halb fertige Runde wurde gespült, statt verworfen zu werden.
Das ist relevant, weil das kleine Ende des Marktes immer voller wird. Am 2. Oktober veröffentlichte Microsoft AI MAI-Transcribe-2-Streaming, ein Echtzeit-Transkriptionsmodell für 60 Sprachen, das erste partielle Ergebnisse in nur etwas über 100 Millisekunden zurückgibt, berichtete The Decoder. Die gleiche Veröffentlichung umfasste MAI-Voice-2.1, das 23 Sprachen in einer Stimme spricht, und eine Flash-Variante mit 150 Millisekunden Latenz und 15 Dollar pro Million Zeichen, herunter von 22 Dollar.
Entscheidungsmodelle sind die andere Flanke. AWS veröffentlichte Strands Decider 2B, ein Open-Source-Modell, das kalibrierte Auswahlmöglichkeiten anstatt Text zurückgibt, aufgebaut auf dem Torso von Qwen3.5-2B, berichtete TechCrunch am 1. Oktober. Amazons Distinguished Engineer Marc Brooker sagte TechCrunch, die Klasse der Modelle mache „einen perfekten Entscheider für einen Workflow-Schritt“. TypeSafe, das sein Jev-Modell nach dem Ökonomen William Stanley Jevons benannte, arbeitet an zukünftigen Versionen; CEO Diogo Almeida sagte TechCrunch, er sehe noch keinen echten Wettbewerb entstehen.
Hardware ist die Einschränkung. Apple liefert jetzt ein Foundation Model auf Macs mit einem M1-Chip oder neuer aus, erreichbar aus dem Terminal mit dem Befehl fm, sobald Apple Intelligence eingerichtet ist, berichtete t3n am 2. Oktober. Das Modell antwortet lokal und trägt keinen Kontext zwischen Prompts.
Forschung erkundet, wo diese Systeme brechen. Ein am 29. September eingereichter Paper spürt Retry-Schleifen in Diffusionssprachmodell-Agenten auf, führt sie auf maskiertes Decoding zurück und schlägt eine trainingsfreie Reverse-Scoring-Regel namens Reflect Reverse vor, laut der arXiv-Zusammenfassung. Ein anderes Paper, am 1. Oktober eingereicht, berichtet, dass Modell-Rankings sich über Agent-Harnesses umkehren: Auf Terminal-Bench 4 führt Claude GPT in OpenHands mit 7,94 Punkten an, fällt aber in PI um 30,16 Punkte zurück, über 66 bewertete Konfigurationen, schreiben die Autoren.
Schach ist der neue günstige Teststand für Prompt-Optimierung, mit 1.118 Lichess-Rätseln und einer Gesamtstudienkosten von etwa 800 Dollar, laut einem am 30. September eingereichten Paper. Das stärkste bewertete Modell, Gemini 3.5 Flash, verwendet als Meta-Modell, löst nur etwa 55% der Rätsel. Anderwoh, ein rangbasiertes Speicher-Controller reduzierte Prompt-Tokens um 5,9% und senkte den unteren halben Tail-Vorhersagefehler um 13,6% gegenüber einer Graph-Speicher-Grundlage auf Synthetic Graph World, mit einer 24,48% Token-Reduktion auf LongMemEval bei gleichbleibender Genauigkeit, laut seinen Autoren.
Coop sitzt am fernen Ende dieser Kurve: kein Datacenter, keine Budgetzeile, eine Leaderboard, die über Validierungsverlust gegen Token statt äußerer Schritte passt. Das Repository merkt an, ein einzelner Validierungsverlust sage nichts aus, weil äußere Schritte ihn genauso oft hoch wie runter bewegen. Die Richtung ist eine Eigenschaft der Serie.
Quellen
8- 01Coop: A small language model pretrained by volunteersEN
- 02Microsoft AI releases new transcription and text-to-speech models for voice agentsEN
- 03Amazon releases its own Jev clone as decision models flood the webEN
- 04Versteckter KI-Chatbot auf dem Mac: So greifst du auf Apples lokales Modell zuDE
- 05Does This Action Still Explain the Task? Reverse Scoring for Diffusion Language Model AgentsEN
- 06Finding the Right Fit: Model-Harness Interactions across Agent TasksEN
- 07Benchmarking Prompt Optimization of Large Language Models With ChessEN
- 08Heavy-Tailed Memory Traces in Long-Horizon Language AgentsEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.