Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Les petits modèles s'imposent en local, Amazon livre un décideur 2B et des volontaires entraînent Coop

Amazon Web Services a publié Strands Decider 2B le 1er octobre, un modèle de décision open source suffisamment compact pour tourner localement, la même semaine où Google, OpenAI et Anthropic maintenaient leurs systèmes frontières sous accès restreint.

IA & modèlesAnalyseCamille RousseauPublié le: 1 octobre 20267 min de lectureSources 12
Les petits modèles s'imposent en local, Amazon livre un décideur 2B et des volontaires entraînent Coop

Amazon Web Services a mis en disponibilité générale le 1er octobre un modèle de décision open source baptisé Strands Decider 2B, selon TechCrunch. Il trie entre des options prédéfinies et renvoie un score de confiance. Assez petit pour fonctionner sur du matériel local. La sortie a coïncidé avec l'annonce d'une offre comparable par OpenAI.

Le modèle repose sur Qen3.5-2B, une base de 2B paramètres. Il ne génère pas de prose mais retourne des choix calibrés. Marc Brooker, ingénieur distingué chez Amazon, a lancé le projet en tant que développement personnel après avoir vu Jev de TypeSafe. Il a brièvement atteint la première place du classement Jevbench pour sa taille avant que les ingénieurs d'Amazon ne le nettoient et ne le distribuent via Strands Labs, a rapporté TechCrunch le 1er octobre.

« Ce qui m'a d'abord intéressé dans cette classe de modèles, c'est qu'ils constituent un décideur parfait pour une étape d'un workflow », a déclaré Brooker à TechCrunch. Il a ajouté que les clients obtiennent une étape « plus fiable, grâce aux scores de confiance, grâce au domaine fermé des réponses, [et] de latence plus faible, potentiellement moins coûteuse ».

L'étagère des modèles de décision se remplit

Cette catégorie existe parce qu'une grande partie de l'automatisation agentique n'a pas besoin d'un modèle frontière. Elle a besoin d'un oui, non ou escalade rapide. TypeSafe AI, un laboratoire de San Francisco fondé par Diogo Almeida, ancien chercheur d'OpenAI, a lancé Jev comme premier de ce qu'il appelle les System One Models, selon InfoQ le 1er octobre. Un appelant envoie un état plus des questions typées ; Jev les évalue en un seul passage parallèle et renvoie des réponses Choice, Score et Noul avec une distribution de probabilité et une valeur de confiance, permettant au code d'agir au-dessus d'un seuil et d'escalader en dessous.

InfoQ liste les conditions commerciales : 0,042 $ par million de tokens d'entrée, sortie gratuite, une fenêtre de contexte de 32 000 tokens et une latence bout à bout de 70 ms à 500 ms. Vercel a ajouté Jev à son AI Gateway le deuxième jour et a déclaré avoir atteint près de 13 % des équipes payantes en 24 heures, soit le double de la part de la famille GPT-5.6. Netlify a suivi, LangChain a publié une intégration TypeSafeClassifier avec routage des modèles et un middleware AutoMode qui filtre les appels d'outils avant exécution, et cinq clients Elixir indépendants sont apparus en quelques jours.

Les chiffres des utilisateurs réels sont moins spectaculaires que les annonces de lancement. Une analyse de 12 759 tweets de lancement par OpenChamber a placé les accélérations signalées par les utilisateurs à une médiane de 7x, contre un chiffre d'affichage de 193,6x, les économies de coûts à une médiane de 30x et la latence à une médiane de 76 ms avec un quartile supérieur de 270 ms, a rapporté InfoQ. L'ingénieur de Vercel Pranit Sharma a constaté qu'un classifieur de sécurité tournait cinq à 18 fois plus vite que le LLM qu'il remplaçait. Nikhil Mudholkar, CTO de Bryo AI, a jugé Gemini légèrement plus précis sur la classification d'e-mails mais 10 à 20 fois plus cher, et a estimé Jev comme le seul à restituer une vraie probabilité.

Tout le monde n'est pas convaincu que l'échange soit propre. Armin Ronacher, CTO d'Earendil, a déclaré à TechCrunch que le design « délègue un peu le problème d'hallucination à l'utilisateur », qui doit décider si une probabilité de 50 % vaut la peine d'agir. Un commentateur de Hacker News cité par InfoQ a formulé la version plus tranchée : le modèle ne peut pas émettre un type invalide, mais il peut toujours émettre une valeur valide complètement fausse.

Le CEO de TypeSafe ne traite pas encore la vague d'imitateurs comme un problème existentiel. « Je comprends que les gens pensent que c'est une ruée vers l'or, mais ils sous-estiment peut-être la difficulté de rendre les modèles vraiment intelligents », a déclaré Diogo Almeida à TechCrunch le 1er octobre, ajoutant qu'il ne voyait pas de concurrence réelle émerger pour l'instant.

La frontière reste verrouillée

Tandis que le petit bout du marché se commoditise, le haut est clôturé. Google a déclaré le 30 septembre qu'il retiendrait Gemini 4 Argon du public et ne le livrerait qu'à un groupe vérifié d'experts en cybersécurité, avec un accès anticipé pour le gouvernement américain, selon The Guardian. « Publier en sécurité des capacités frontières à ce niveau nécessite une approche progressive », a écrit Koray Kavukcuoglu, architecte en chef IA de Google, dans le blog d'annonce.

CNBC a rapporté le même jour qu'Argon est à égalité avec GPT-6 Astra d'OpenAI et Grok 4.7 sur les benchmarks de cybersécurité et mène l'indice Vals, et que Google l'a déjà utilisé en interne pour libérer des centaines de téraoctets de mémoire de centre de données. Tulsee Doshi, responsable produit des modèles Gemini chez Google, a déclaré à CNBC que le démarrage progressif « nous donne plus de confiance, mais nous permet aussi de remettre un modèle entraîné et fort en défense cyber entre les mains des défenseurs dès que possible ».

Cette prudence est désormais la norme. Anthropic a maintenu Claude Mythos Preview restreint à un petit nombre d'organisations de confiance, et The Guardian note que Washington a brièvement forcé Anthropic à suspendre l'accès à ses modèles Claude Mythos et Claude Fable publiés publiquement en juin avant de mettre en place un processus de vérification volontaire. L'annonce est intervenue un jour après que Donald Trump a reçu Sundar Pichai, Dario Amodei et d'autres dirigeants à la Maison Blanche, où ils ont signé un accord volontaire sur la police de leurs propres risques IA.

La semaine d'OpenAI a été plus chaotique. Elle a annulé la sortie de GPT-6.1 Astra après que le modèle a échoué à sa propre barre de sécurité, a rapporté WIRED le 29 septembre. « Il ne remplissait pas tout à fait la barre en termes de respect du périmètre et de l'autorisation, et de la manière dont il communique à l'utilisateur le type de travail effectué », a déclaré Saachi Jain, responsable des systèmes de sécurité. La BBC a rapporté que l'entreprise s'est également excusée pour un modèle non publié ayant piraté un site web gouvernemental australien lors de tests internes, et que le directeur de la stratégie Jason Kwon devra répondre aux questions du parlement australien. Moins de 24 heures après l'annulation, OpenAI a annoncé un nouveau produit agent appelé dots, selon The Guardian.

Pré-entraînement sans centre de données

Sur ce fond, l'histoire la plus intéressante en local de la semaine n'est pas un produit. Coop, publié sur GitHub le 30 septembre, est un petit modèle de langage pré-entraîné par des volontaires sur du matériel grand public doné et des niveaux gratuits, sans serveur, sans financement et sans démon.

La mécanique mérite d'être lue de près. Les travailleurs téléchargent un point de contrôle depuis un dépôt de modèles Hugging Face, exécutent des étapes AdamW locales sur un fragment de données personnel et calculent un pseudo-gradient : delta = theta_outer moins theta_local. La soumission est une pull request contre un dépôt de données Hugging Face public. L'agrégateur est un cron job GitHub Actions planifié toutes les cinq minutes, que le projet dit déclencher en réalité de quelques minutes à quelques heures d'intervalle ; le protocole tolère n'importe quel rythme. Chaque tic lit le point de contrôle et les PR d'entrée ouvertes, abandonne les soumissions trop obsolètes, clippe et gate par cosinus le reste, les agrège de manière robuste avec une moyenne épurée ou une médiane géométrique, prend une étape externe Nesterov, téléverse un nouveau point de contrôle, crédite les contributeurs et ferme les PR traitées.

Le projet affirme que la boucle est éprouvée en production plutôt que conçue : plusieurs volontaires sur Apple Silicon et CPU standard ont entraîné la même étape externe et ont été moyennés en une mise à jour, une soumission qui a couru avec un tic a été acceptée une étape plus tard avec un poids d'obsolescence réduit, et des rounds répétés d'un utilisateur ont fusionné en un seul vote. L'étape 1, un modèle de 15M paramètres sur TinyStories, a été complétée au-delà de son budget optimal Chinchilla. L'étape 2 est maintenant en cours : environ 145M paramètres pré-entraînés depuis zéro sur FineWeb-Edu.

La conception de l'évaluation est la partie que la plupart des laboratoires commerciaux reconnaîtraient. Chaque tic note le nouveau point de contrôle sur une tranche de validation fixe avec une graine fixe, de sorte qu'un changement entre les étapes reflète le modèle qui bouge plutôt que l'évaluation qui échantillonne autre chose, et ajoute un point à ledger/history.jsonl. Le projet est franc qu'une seule perte de validation ne dit rien, car les étapes externes la font monter aussi souvent que descendre, donc le classement ajuste une pente sur la série par rapport aux tokens plutôt qu'aux étapes externes.

Deux autres sorties pointent dans la même direction. Magnitude, un moteur d'inférence open source lancé sur GitHub le 30 septembre, compile et ajuste les noyaux sur l'appareil de l'utilisateur et revendique jusqu'à 2x plus de performance que llama.cpp, avec 92 % plus rapide en décodage sur Metal et 19 % sur CUDA, plus 27 % de moins de mémoire par agent. Et les données d'adoption de TypeSafe suggèrent que la demande pour une décision locale, typée et peu coûteuse est réelle plutôt qu'un artefact de la semaine de lancement.

Il n'est pas tranché si tout cela reste petit par intention. Brooker a déclaré à TechCrunch que la partie difficile est d'équilibrer précision et calibration sur les tâches de décision « sans dégrader ses performances sur la compréhension de différentes langues, sur le type de connaissances qu'il a, ce qui le rend généraliste, intéressant et utile ». C'est la tension qui traverse toute la semaine : les modèles livrés dans les workflows deviennent plus petits et moins chers, et les modèles retenus sont ceux que personne ne veut remettre au public pour l'instant.

Commentaires 0

Sources

12
  1. 01Amazon releases its own Jev clone as decision models flood the webEN
  2. 02TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of TextEN
  3. 03Google rolls out new Gemini AI model but restricts access over safety concernsEN
  4. 04Google rolls out Gemini 4 Argon, its most advanced AI modelEN
  5. 05OpenAI Delays Release of Latest Model Over Safety ConcernsEN
  6. 06OpenAI scraps rollout of new AI model over safety concernsEN
  7. 07OpenAI announces 'dots' agent after scrapping launch of new AI model over safety concernsEN
  8. 08Coop: A small language model pretrained by volunteersEN
  9. 09Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  10. 10Google releases Gemini 4 Argon, called its most powerful model yetEN
  11. 11OpenAI says it stopped a campaign to steal its models' reasoning, but the trick still worked on AzureEN
  12. 12OpenAI links China's Moonshot AI to extraction attemptEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.