Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Les petits modèles de langage passent sur l'appareil, la recherche court encore derrière

La famille OpenELM d'Apple va de 270 millions à 3 milliards de paramètres, et Gemma 3 1B de Google tourne à 529 Mo. Mais un article de 2026 constate que les signaux de confiance au niveau du token restent proches de zéro dans 91 % des combinaisons jeu de données-modèle.

IA & modèlesExpliquéSophie LeclercPublié le: 28 septembre 20264 min de lectureSources 6
Les petits modèles de langage passent sur l'appareil, la recherche court encore derrière

Les petits modèles de langage, ceux de moins de 3 milliards de paramètres qui tournent sur un téléphone plutôt que dans un centre de données, sont passés en deux ans environ de curiosité de laboratoire à produit commercialisé. L'argument est simple : garder le modèle en local, réduire les coûts de serveur et laisser les données des utilisateurs sur un matériel qui n'appartient à personne d'autre. Les preuves sont plus mitigées que le marketing ne le laisse entendre.

La contribution d'Apple est le point de départ le plus clair. Le 24 avril 2024, Ars Technica a rapporté que l'entreprise avait publié huit modèles sous le nom OpenELM, pour Open-source Efficient Language Models, sur Hugging Face sous une licence Apple Sample Code. Ars Technica note que cette licence comporte des restrictions qui ne correspondent pas à la définition communément admise de l'open source, même si le code source est disponible. Les modèles vont de 270 millions à 3 milliards de paramètres, en quatre variantes pré-entraînées et quatre variantes ajustées aux instructions, avec une fenêtre de contexte maximale de 2 048 tokens. Le livre blanc d'Apple indique qu'une « layer-wise scaling strategy » a apporté une amélioration de précision de 2,36 % par rapport à OLMo 1B d'Allen AI, tout en utilisant moitié moins de tokens de pré-entraînement.

Ars Technica replace cela dans son contexte : la famille Llama 3 de Meta plafonnait alors à 70 milliards de paramètres, avec une version à 400 milliards en développement, et GPT-3 d'OpenAI, sorti en 2020, comptait 175 milliards de paramètres. Le nombre de paramètres est une mesure approximative, pas un verdict.

Ce que mesurent réellement les articles de benchmark

SlimLM, déposé sur arXiv le 15 novembre 2024, a pris une voie plus étroite : l'assistance documentaire. Les auteurs, Thang M. Pham et quatre coauteurs, ont testé des modèles de 125M à 7B paramètres sur un Samsung Galaxy S24. Ils les ont pré-entraînés sur SlimPajama-627B, puis ajustés sur un jeu de données qu'ils ont construit, appelé DocAssist, pour la synthèse, les questions-réponses et les suggestions. Leur résumé revendique des performances comparables ou supérieures à celles des petits modèles existants et décrit une application Android comme référence de déploiement. Le point est utile parce qu'il nomme ensemble le matériel, la tâche et la taille des modèles, ce que la plupart des affirmations sur l'inférence embarquée ne font pas.

L'équipe AI Edge de Google a vu plus large. Dans un billet de blog développeur du 20 mai 2025, Mark Sherwood, Matthew Chan, Marissa Ikonomidis et Milen Ferev ont annoncé la prise en charge de plus d'une douzaine de modèles, dont Gemma 3 et Gemma 3n, hébergés sur une nouvelle communauté LiteRT sur Hugging Face. Gemma 3 1B pèse 529 Mo et peut atteindre 2 585 tokens par seconde en pré-remplissage sur le GPU mobile. Selon Google, il traite ainsi jusqu'à une page de contenu en moins d'une seconde. Gemma 3n, en variantes 2B et 4B, est présenté comme le premier petit modèle de langage multimodal embarqué de Gemma. Il prend en charge texte, image, vidéo et audio, le texte et l'image étant disponibles en premier. Le billet présente aussi des bibliothèques de RAG embarqué et d'appel de fonctions, toutes deux disponibles sur Android au lancement.

Vient ensuite la couche sceptique. Un article intitulé « Do small language models know what they don't know? » a été soumis à arXiv le 21 juillet 2026 par Prashant Mudgal. Il évalue sept approches de confiance fondées sur l'entropie, sur 7 paires de modèles et 5 benchmarks NLU. Le résultat principal est sans détour : l'entropie au niveau du token est en pratique aveugle dans les petits modèles. Elle reste proche de zéro, que la réponse soit correcte ou non, dans 91 % des combinaisons jeu de données-modèle. L'entropie sémantique, calculée en échantillonnant et en regroupant les réponses par sens, retrouve un signal exploitable. Router les requêtes incertaines vers un modèle expert plus grand a amélioré la précision jusqu'à 50 points de pourcentage. Le routage entre familles atteint en moyenne +22,0 %, contre +6,8 % pour le routage au sein d'une même famille.

Raisonner sans le commentaire en direct

Science News a rapporté le 22 septembre 2026 le cas de BDH-CQ, un petit système expérimental soumis à arXiv le 10 août qui résout certains puzzles de raisonnement sans écrire les étapes intermédiaires. La spécialiste de la complexité Zuzanna Stamirowska, directrice générale de l'entreprise d'IA Pathway, a déclaré à Science News : « Une fois la requête arrivée, le modèle n'écrit pas du tout son raisonnement en mots. » Le modèle a résolu près de trois puzzles sur dix du jeu d'évaluation public ARC-AGI-1 en deux tentatives. Stamirowska et ses collègues estiment que chaque requête de puzzle coûte environ 0,00070 $ à exécuter, soit à peu près un onzième de GPT-5.6 Luna sur le même benchmark. Science News précise toutefois que les deux coûts ont été calculés différemment et que l'étude n'a pas été évaluée par des pairs.

Tout le monde n'est pas convaincu. L'informaticien Yuntian Deng, de l'université de Waterloo, a déclaré à Science News que le résultat était « un résultat d'efficacité intéressant », mais qu'il ne montrait pas que l'architecture soit meilleure que d'autres approches. Sans raisonnement écrit, le modèle est aussi plus difficile à inspecter. Jonas Geiping, de l'ELLIS Institute Tübingen et de l'Institut Max Planck pour les systèmes intelligents, a qualifié l'approche de « neat », mais a estimé que BDH-CQ avait été conçu spécifiquement pour les problèmes de type ARC, ce qui rend la comparaison directe avec des systèmes généralistes difficile.

Le déploiement devance déjà les articles. Bouncer d'Imbue, un filtre de flux Twitter publié le 8 avril 2026, utilise un modèle open source que l'entreprise appelle Gemma 4 26B-A4B pour la classification, servi depuis le propre centre de données d'Imbue pour l'instant. L'ingénieur Millan Philipose écrit que l'équipe travaille à le faire tourner directement sur des ordinateurs portables et des téléphones. C'est dans cet écart entre l'ambition et un modèle de 529 Mo sur un téléphone que sera testée la majeure partie de la prochaine vague d'affirmations.

Commentaires 0

Sources

6
  1. 01Apple releases eight small AI language models aimed at on-device useEN
  2. 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
  3. 03On-device small language models with multimodality, RAG, and Function CallingEN
  4. 04Do small language models know what they don't know?EN
  5. 05Can AI reason without words? A small model puts the idea to the testEN
  6. 06Show HN: Control your X/Twitter feed using a small on-device LLMEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.