Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Les petits modèles de langage passent en local : Apple, Google, Imbue et Cactus poussent l'IA embarquée

Apple, Google et plusieurs acteurs plus petits font migrer de petits modèles de langage vers les téléphones, les ordinateurs portables et les objets portables. Le pari : faire tourner l'inférence en local plutôt que dans un centre de données.

IA & modèlesActualitéCamille RousseauPublié le: 27 septembre 20265 min de lectureSources 6
Les petits modèles de langage passent en local : Apple, Google, Imbue et Cactus poussent l'IA embarquée

Apple a publié huit petits modèles de langage à code source disponible en avril 2024, sous le nom OpenELM. Ils vont de 270 millions à 3 milliards de paramètres, selon Ars Technica. Les modèles sont hébergés sur Hugging Face sous une Apple Sample Code License. Ars Technica note que cette licence pourrait ne pas répondre à la définition communément admise de l'open source, à cause des restrictions qu'elle impose, même si le code source est accessible.

Sur les huit, quatre sont pré-entraînés et quatre sont affinés sur instructions. Tous partagent une fenêtre de contexte maximale de 2 048 tokens. Les données d'entraînement : RefinedWeb, une version dédupliquée de PILE, un sous-ensemble de RedPajama et un sous-ensemble de Dolma v1.6. Apple annonce un total d'environ 1,8 billion de tokens.

Le livre blanc d'Apple affirme qu'une stratégie de mise à l'échelle couche par couche a apporté à OpenELM un gain de précision de 2,36 pour cent par rapport à OLMo 1B d'Allen AI, avec deux fois moins de tokens de pré-entraînement. L'entreprise a aussi publié CoreNet, la bibliothèque d'entraînement, et des recettes reproductibles pour que les poids puissent être répliqués. Ars Technica a qualifié cela d'inhabituel pour une grande entreprise technologique à l'époque.

Le nombre de paramètres donne une idée approximative des capacités, et les modèles d'Apple se situent bien en dessous des plus grands systèmes. La famille Llama 3 de Meta avait atteint 70 milliards de paramètres, avec une version à 400 milliards en préparation. GPT-3 d'OpenAI est sorti avec 175 milliards en 2020. Le pari de la recherche : les petits modèles peuvent désormais égaler ce que faisaient les beaucoup plus grands il y a quelques années.

Google ajoute des modalités, le RAG et l'appel de fonctions

L'équipe AI Edge de Google a annoncé le 20 mai 2025 avoir élargi le support des petits modèles de langage embarqués, passant de quatre modèles initiaux à plus d'une douzaine, dont Gemma 3 et Gemma 3n, hébergés dans une nouvelle communauté LiteRT sur Hugging Face. Gemma 3n est arrivé en aperçu anticipé. Google le présente comme le premier petit modèle de langage embarqué multimodal de Gemma, avec des variantes à 2B et 4B paramètres prenant en charge le texte, l'image, la vidéo et l'audio. Le texte et l'image étaient disponibles sur Hugging Face en premier, l'audio devant suivre.

Google a aussi chiffré le travail de compression. Selon l'entreprise, la quantification post-entraînement en int4 peut réduire les modèles de langage d'un facteur de 2,5 à 4 fois par rapport au bf16, tout en diminuant la latence et la mémoire de pointe. Gemma 3 1B, à 529MB, peut atteindre jusqu'à 2 585 tokens par seconde en pré-remplissage sur un GPU mobile. Google affirme que cela suffit pour traiter une page de contenu en moins d'une seconde.

Deux bibliothèques accompagnent les modèles. La bibliothèque AI Edge RAG, disponible sur Android au lancement, permet à un modèle de s'appuyer sur des données propres à une application sans affinage. Google dit qu'elle peut sélectionner les éléments les plus pertinents parmi 1 000 pages ou 1 000 photos. La bibliothèque Function Calling, également d'abord sur Android, permet à un modèle de décider quand appeler des fonctions prédéfinies, avec une application d'exemple qui remplit un formulaire médical à partir d'une dictée vocale.

La reproductibilité et la transparence des grands modèles de langage sont cruciales pour faire avancer la recherche ouverte, garantir la fiabilité des résultats et permettre d'étudier les biais des données et des modèles, ainsi que les risques potentiels.

Cette phrase vient du résumé de l'article d'Apple sur OpenELM, cité par Ars Technica. Apple a aussi prévenu que, les modèles ayant été entraînés sur des jeux de données publics, ils peuvent produire des sorties inexactes, nuisibles, biaisées ou choquantes. Ars Technica rapportait qu'iOS 18, attendu pour une présentation en juin à la WWDC, était soupçonné d'inclure des fonctions d'IA embarquée, avec la possibilité qu'Apple fasse appel à Google ou OpenAI pour le traitement plus lourd hors appareil.

Des benchmarks sur un téléphone, et un filtre pour votre fil d'actualité

Un article arXiv de novembre 2024 signé notamment par Thang M. Pham présentait SlimLM, une série de modèles ajustés pour l'assistance documentaire sur mobile. Les auteurs ont mené des expériences sur un Samsung Galaxy S24 pour trouver les compromis entre la taille du modèle, de 125M à 7B paramètres, la longueur du contexte et le temps d'inférence. SlimLM a été pré-entraîné sur SlimPajama-627B et affiné sur DocAssist, un jeu de données construit par les auteurs pour le résumé, les questions-réponses et les suggestions. Ils ont aussi livré une application Android.

Bouncer d'Imbue adopte un autre angle. Publié le 8 avril 2026 et mis à jour le 25 septembre 2026, il filtre un fil X/Twitter à partir d'une description en langage courant, en utilisant un modèle open source que l'entreprise appelle Gemma 4 26B-A4B. Imbue dit servir ce modèle depuis son propre centre de données pour l'instant, tout en travaillant à l'exécuter directement sur un ordinateur portable ou un téléphone. Bouncer est disponible en extension Chrome, en module Firefox et en application iPhone. La prise en charge de Reddit, LinkedIn et Safari est annoncée comme à venir.

Needle 3 de Cactus Compute, publié le 18 septembre 2026, descend encore plus bas. L'entreprise décrit des modèles échelonnés de 29-121M paramètres produisant des binaires CQ2 de 9 à 29 MB, avec une vitesse de 400 à 4 000 tokens par seconde en décodage et de 1 à 10 000 tokens par seconde en pré-remplissage sur un Raspberry Pi 5. Cactus affirme que le sous-réseau à 4 couches peut égaler DeepSeek V4 Flash lorsqu'il est ajusté sur des tâches en aval pendant une époque.

Needle 3 vise les appels d'outils, l'extraction structurée et l'embedding de texte, avec des cas d'usage cités dans la domotique, les robots, les téléphones, les objets portables, les lunettes AR, les voitures et les PC. Chaque réponse porte un score de confiance issu d'une tête calibrée. Le moteur applique un plancher de 0,1, en dessous duquel les appels sont retenus dans un champ suppressed_calls.

Un résultat de recherche va à l'encontre de l'enthousiasme. Un article soumis le 21 juillet 2026 par Prashant Mudgal a constaté que l'entropie au niveau des tokens est pratiquement aveugle dans les modèles de moins de 3 milliards de paramètres : dans 91 pour cent des combinaisons jeu de données-modèle, l'entropie moyenne des tokens était proche de zéro, que la réponse soit correcte ou non. L'entropie sémantique, calculée en échantillonnant plusieurs réponses et en les regroupant par sens, a retrouvé un signal exploitable. Router les requêtes incertaines vers un modèle expert plus grand a amélioré la précision jusqu'à 50 points de pourcentage, le routage entre familles atteignant en moyenne +22,0 pour cent contre +6,8 pour cent pour le routage au sein d'une même famille.

L'article est direct sur ce que cela signifie pour l'inférence locale. La valeur des méthodes d'entropie dans les petits modèles ne réside pas dans les économies de calcul, soutient-il, mais dans l'allocation intelligente de la puissance de calcul : dépenser plus de tokens là où cela compte le plus. Pour l'instant, l'argument de l'IA embarquée repose donc sur la confidentialité, la latence et le coût, la question plus difficile de la fiabilité restant ouverte.

Commentaires 0

Sources

6
  1. 01Apple releases eight small AI language models aimed at on-device useEN
  2. 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
  3. 03On-device small language models with multimodality, RAG, and Function CallingEN
  4. 04Do small language models know what they don't know?EN
  5. 05Show HN: Control your X/Twitter feed using a small on-device LLMEN
  6. 06Show HN: Cactus Needle 3: 8-29MB automation models can match DeepSeek V4 FlashEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.