Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Le modèle de 145 M de Coop entraîné par des volontaires et la montée des petits modèles

Selon le dépôt GitHub mis à jour le 30 septembre, un modèle de langage de 145 de paramètres est désormais en cours de préentraînement depuis zéro sur du matériel grand public fourni par des bénévoles, sans serveurs ni financement.

IA & modèlesAnalyseCamille RousseauPublié le: 2 octobre 20263 min de lectureSources 8
Le modèle de 145 M de Coop entraîné par des volontaires et la montée des petits modèles

Le projet s'appelle Coop. Son dépôt décrit une boucle d'entraînement qui s'exécute entièrement sur des machines de volontaires, complétées par les offres gratuites de Hugging Face et GitHub Actions.

La phase 2 est active : un modèle d'environ 145 M de paramètres se préentraîne sur FineWeb-Edu. La phase 1, une exécution de 15 M de paramètres sur TinyStories, a dépassé son budget de tokens optimal de Chinchilla. Les bénévoles téléchargent un point de contrôle, exécutent un certain nombre d'étapes locales AdamW sur une tranche de données personnelle et soumettent un pseudo-gradient sous forme de demande d'extraction (pull request) vers un dépôt public de jeu de données Hugging Face. Une tâche cron GitHub Actions, planifiée toutes les cinq minutes, lit les demandes d'extraction ouvertes, écarte celles qui sont obsolètes, clippe et contrôle le reste, les agrège via une moyenne tronquée ou une médiane géométrique, effectue une étape de Nesterov et téléverse un nouveau point de contrôle. Le dépôt précise que le planificateur partagé de GitHub se déclenche en réalité à des intervalles variant de quelques minutes à quelques heures, et que le protocole tolère toute cadence.

Le projet affirme que sa boucle est éprouvée en production plutôt que simplement conçue. Plusieurs bénévoles, sur Apple Silicon et CPU standard, ont entraîné la même étape externe et l'ont fusionnée dans une seule mise à jour. Une soumission qui a concouru avec un tic a été acceptée une étape plus tard avec un poids de stélasticité réduit, les rounds répétés d'un même utilisateur ont été fusionnés en un seul vote, et un round à moitié terminé a été purgé au lieu d'être jeté.

Cela compte car l'extrémité basse du marché se densifie. Le 2 octobre, Microsoft AI a publié MAI-Transcribe-2-Streaming, un modèle de transcription en temps réel couvrant 60 langues qui renvoie les premiers résultats partiels en un peu plus de 100 millisecondes, a rapporté The Decoder. Cette même publication incluait MAI-Voice-2.1, qui parle 23 langues avec une seule voix, et une variante Flash avec une latence de 150 millisecondes et un coût de 15 dollars par million de caractères, en baisse par rapport à 22 dollars.

Les modèles de décision sont l'autre front. AWS a publié Strands Decider 2B, un modèle open source qui renvoie des choix calibrés au lieu de texte, construit sur le squelette de Qwen3.5-2B, a rapporté TechCrunch le 1er octobre. Marc Brooker, ingénieur distingué chez Amazon, a déclaré à TechCrunch que cette classe de modèles constitue « un décideur parfait pour une étape de workflow ». TypeSafe, qui a nommé son modèle Jev d'après l'économiste William Stanley Jevons, travaille sur des versions futures ; le CEO Diogo Almeida a dit à TechCrunch ne pas encore voir émerger une vraie concurrence.

Le matériel est la contrainte. Apple équipe désormais les Macs dotés d'une puce M1 ou plus récente d'un Foundation Model, accessible depuis le terminal avec la commande fm une fois Apple Intelligence configuré, a rapporté t3n le 2 octobre. Le modèle répond localement et ne conserve pas le contexte entre les prompts.

La recherche sonde là où ces systèmes se brisent. Un article soumis le 29 septembre trace les boucles de réessai dans les agents de modèles de langage de diffusion jusqu'au décodage masqué et propose une règle de notation inverse sans entraînement appelée Reflect Reverse, selon l'abstract arXiv. Un autre article, soumis le 1er octobre, rapporte que les classements de modèles s'inversent selon les harnais d'agents : sur Terminal-Bench 4, Claude devance GPT de 7,94 points dans OpenHands mais le talonne de 30,16 points dans PI, sur 66 configurations évaluées, écrivent les auteurs.

Les échecs sont le nouveau banc d'essai bon marché pour l'optimisation de prompts, avec 1 118 puzzles Lichess et un coût total d'étude d'environ 800 dollars, selon un article soumis le 30 septembre. Le modèle évalué le plus fort, Gemini 3.5 Flash, utilisé comme méta-modèle, ne résout que environ 55 % des puzzles. Ailleurs, un contrôleur de mémoire basé sur le rang a réduit les tokens de prompt de 5,9 % et abaissé l'erreur de prédiction de la queue inférieure de 13,6 % par rapport à une référence de mémoire graphique sur Synthetic Graph World, avec une réduction de 24,48 % des tokens sur LongMemEval à précision égale, selon ses auteurs.

Coop se situe à l'extrémité de cette courbe : pas de centre de données, pas de ligne budgétaire, un tableau de classement ajusté sur la perte de validation par rapport aux tokens plutôt qu'aux étapes externes. Le dépôt note qu'une perte de validation unique ne dit rien, car les étapes externes la font monter aussi souvent que descendre. La direction est une propriété de la série.

Commentaires 0

Sources

8
  1. 01Coop: A small language model pretrained by volunteersEN
  2. 02Microsoft AI releases new transcription and text-to-speech models for voice agentsEN
  3. 03Amazon releases its own Jev clone as decision models flood the webEN
  4. 04Versteckter KI-Chatbot auf dem Mac: So greifst du auf Apples lokales Modell zuDE
  5. 05Does This Action Still Explain the Task? Reverse Scoring for Diffusion Language Model AgentsEN
  6. 06Finding the Right Fit: Model-Harness Interactions across Agent TasksEN
  7. 07Benchmarking Prompt Optimization of Large Language Models With ChessEN
  8. 08Heavy-Tailed Memory Traces in Long-Horizon Language AgentsEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.