Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Petits modèles embarqués : 91 % des signaux d'entropie par jeton sont inutilisables, selon un article

Dans les petits modèles de langue de moins de 3 milliards de paramètres, les signaux de confiance au niveau du jeton ne disent presque rien. Une prépublication arXiv déposée le 21 juillet a mesuré une entropie moyenne par jeton proche de zéro dans 91 % des combinaisons jeu de données-modèle, que la réponse soit juste ou non.

IA & modèlesAnalyseCamille RousseauPublié le: 28 septembre 20264 min de lectureSources 6
Petits modèles embarqués : 91 % des signaux d'entropie par jeton sont inutilisables, selon un article

Prashant Mudgal a testé sept approches sur 7 paires de modèles et 5 benchmarks NLU standard, tous exécutés sur du matériel grand public. Sa conclusion est sans détour : à cette échelle, l'arrêt anticipé fondé sur l'entropie au niveau du jeton ne fonctionne pas. L'entropie sémantique, elle, retrouve un signal exploitable. Elle se calcule en générant plusieurs échantillons et en regroupant les réponses par sens. En routant les requêtes incertaines vers un modèle expert plus grand, on gagne jusqu'à 50 points de précision.

Le routage entre familles différentes a donné en moyenne +22,0 %, contre +6,8 % pour les paires d'une même famille. L'exemple cité est SmolLM 360M qui passe la main à Phi-3.5-mini. Pour l'auteur, la valeur des méthodes d'entropie dans les petits modèles ne tient pas au calcul économisé mais au calcul alloué.

Pourquoi le travail embarqué ne cesse de croître

Le calendrier compte. Le 27 septembre, Nvidia a publié Nemotron 3 Diarization, un modèle d'environ 100 millions de paramètres qui identifie qui parle dans une conversation, avec des poids téléchargeables gratuitement, comme l'a rapporté The Decoder. Il sépare jusqu'à huit locuteurs et signale les chevauchements de parole. Sur le Diarization-Bench de VoiceArena, il occupe actuellement la première place avec un taux d'erreur de 14,72 %, devant le système suivant à 19,3 %. Associé à un système de reconnaissance vocale comme Parakeet, il produit des transcriptions avec des étiquettes de locuteurs anonymes. Les taux d'erreur augmentent avec le nombre de participants, le bruit de fond ou la réverbération.

La latence est un compromis de conception, pas un gain gratuit. Le tampon audio peut être réglé sur quatre niveaux, de 30,4 secondes à 0,32 seconde, et des tampons plus courts réduisent généralement la précision. Nvidia affirme que le modèle réduit le taux d'erreur de 41 % en moyenne sur huit scénarios de test par rapport à son prédécesseur Streaming Sortformer avec un tampon de 1,04 seconde. C'est le genre de chiffre qui compte quand le modèle doit tourner en local plutôt que dans un centre de données.

La même semaine a apporté un projet bien plus gros, avec une affirmation bien plus étroite sur l'automatisation. Une équipe réunissant des chercheurs de l'université Fudan, en Chine, a étudié son propre travail de construction d'Atria Dawn Preview, un modèle de langue agentique sur une architecture mixture-of-experts de 744 milliards de paramètres, selon The Decoder. L'analyse a porté sur plus de 700 journaux de tâches issus de 56 participants. L'IA a été utilisée dans 96,5 % des tâches examinées, et le ratio médian des actions de l'agent aux saisies humaines est passé de 11 à 28,5 en quatre semaines. Les auteurs mettent en garde contre une lecture en termes d'autonomie : chaque décision humaine déclenchait simplement davantage d'étapes de l'agent.

Les participants ont été interrogés pour savoir s'ils auraient pu accomplir leur part d'une tâche sans IA, à périmètre et qualité égaux. Sur 455 tâches assistées par IA achevées, 151 ont été jugées irréalisables sans IA, soit environ un tiers, réparties sur 27 des 56 participants.

Les humains ont encore pris 85,5 % des décisions sur les méthodes et les paramètres, contre 9,2 % pour l'IA, et ils ont tranché en dernier ressort sur les objectifs et le périmètre dans 93,4 % des cas. Quand les choses ont mal tourné sur 588 tâches avec une difficulté enregistrée, 76 % ont avancé grâce à une intervention humaine et 23 % ont été résolues par l'agent seul. L'article avertit que lorsque chaque décision repose sur une chaîne de travail d'agent plus longue qu'aucun humain ne peut relire, la supervision se dégrade en approbation automatique.

Modèles bon marché, questions coûteuses

Le coût redessine quels modèles sont utilisés tout court. CNBC a rapporté le 26 septembre que les modèles chinois représentaient 57 % à 67 % des jetons utilisés sur OpenRouter dans la semaine du 14 septembre, contre 6 % à 13 % en février, et qu'ils ont atteint 55 % des jetons sur Vercel en août, contre 11 % en janvier. Peter Walker, responsable des analyses chez OpenRouter, a déclaré à CNBC que les modèles ouverts chinois sortis cette année peuvent prendre en charge de manière crédible des tâches agentiques avancées, en particulier le codage, ce qui n'était pas vrai fin 2025, et qu'ils sont bon marché face à la plupart des modèles des laboratoires américains. Harpreet Arora, responsable de l'infrastructure agentique chez Vercel, a déclaré que le prix devient convaincant dès qu'un modèle franchit le seuil de qualité pour un travail donné.

Washington surveille. Deux commissions de la Chambre des représentants américaine enquêtent sur cette tendance à l'adoption, et CNBC note que les modèles de pointe américains attirent toujours plus de dépenses globales. Daniel Remler, du Center for a New American Security, a déclaré au média que l'inquiétude est que cette intégration n'entraîne des pays dans une sphère technologique chinoise. Les données citées par CNBC sont contrastées : environ la moitié des jetons sur OpenRouter viennent d'entreprises américaines, tandis que les entreprises des 82 pays qu'OpenRouter regroupe sous l'étiquette Global South envoient 67 % de leurs jetons à des modèles chinois.

Les petits modèles occupent une position inconfortable dans ce bras de fer. Ils tournent sur l'appareil, ce qui contourne certains arguments de contrôle des exportations, mais leur fiabilité est précisément ce que l'article arXiv remet en question. Son résultat sur le routage suggère que la réponse pratique n'est pas un meilleur petit modèle en soi, mais un petit modèle qui sait quand demander de l'aide.

Commentaires 0

Sources

6
  1. 01Do small language models know what they don't know?EN
  2. 02Nvidia drops a free 100M-parameter model that identifies up to eight speakers in real timeEN
  3. 03AI agents do more of the work in model development, but humans still make the decisionsEN
  4. 04Chinese AI models surge in global popularity — and Washington is worriedEN
  5. 05OpenAI halts training of latest models as reports mount of AI agents going rogueEN
  6. 06OpenAI pauses training of its 'most capable models'EN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.