Les modèles de décision laissent tomber la génération de texte pour les logits
Deux modèles sortis le 29 septembre défendent la même idée : plutôt que de générer des tokens, les petits modèles doivent renvoyer des probabilités calibrées. Le d1 de Liquid AI et Qevi-2B, un fine-tune de Qwen3-VL-2B, fonctionnent tous les deux ainsi.

Les deux sont arrivés mardi à six minutes d'intervalle. Liquid AI a publié à 20:09 UTC la documentation de d1, qu'elle présente comme son premier modèle de décision. MeerDevelopment a mis Qevi-2B en ligne sur Hugging Face à 20:16 UTC. Ni l'un ni l'autre ne génère de texte.
La documentation de Liquid AI est directe sur le mécanisme. Un modèle de décision « évalue une situation et renvoie des probabilités calibrées sur un ensemble fixe de résultats en un seul appel, sans aucun token généré ». L'API expose trois formes de question : noul (oui/non, renvoie un float), choice (choisir une option parmi des choix nommés) et score (une position pondérée par probabilité sur une grille ordonnée). Dans l'exemple de la documentation, la chaîne « J'attends ma commande depuis plus de trois semaines et personne n'a répondu à mes courriels » renvoie un noul de 0,999 pour la question « Ce message est-il une réclamation du client ? » La réponse indique aussi usage.output_tokens à 0.
Lire les logits, ignorer la phrase
Qevi-2B emprunte un autre chemin vers la même destination. C'est un fine-tune complet de Qwen3-VL-2B-Instruct. Il répond à des questions fermées sur des images en lisant les logits de la tête LM à la position où le modèle commencerait à répondre, restreints aux tokens de réponse autorisés. Demandez-lui s'il y a une échelle sur une photo : il renvoie P(Oui) = 0,97. La fiche du modèle prévient qu'appeler .generate() et analyser le texte ne reproduira pas les chiffres publiés, « parce que ce n'est pas le chemin sur lequel le modèle a été affiné ».
Les gains annoncés sont importants et précis. Face au Qwen3-VL-2B de base passé par le même chemin de lecture, Qevi-2B obtient 0,977 de précision en domaine contre 0,855, et 0,889 sur des domaines tenus à l'écart contre 0,745. L'erreur de calibration attendue sur les données tenues à l'écart tombe de 0,160 à 0,054. La fiche signale aussi une inférence environ 21 fois plus rapide lorsqu'on pose beaucoup de questions sur une seule image : le regroupement des questions partage un seul encodage d'image.
Une réserve mérite une lecture attentive. Le corpus d'entraînement ne couvre que les questions de type noul et choice, donc le type score n'est pas testé. Et la fiche retire explicitement les recommandations de température antérieures : à T = 2,45, l'ECE sur données tenues à l'écart revient à 0,160, ce qui efface tout le gain de calibration.
Petit, rapide et taillé pour la classification
Voilà l'argument embarqué dans sa forme actuelle. Le guide d'Ailoitte sur le développement de petits modèles, publié dans les 12 dernières heures, le formule en termes de coût : servir un modèle 7B peut être « 10 à 30 fois moins cher en latence, en énergie et en calcul » qu'un modèle de 70B à 175B, citant un document de position de NVIDIA de 2025. Il note aussi que les petits modèles tournent sur site, ce qui compte pour les données de santé et de finance.
L'essai de Sebastian Raschka du 29 septembre sur la classification de texte fait le même constat par l'autre bout. Il décrit Jev, un modèle qui a provoqué « un véritable phénomène culturel dans les communautés techniques ces 2 dernières semaines », comme essentiellement un classifieur de texte, plus rapide et moins cher que les LLM généraux en classification, tout en restant plus général que les modèles spécifiques à une tâche. Il précise qu'il n'a aucune affiliation avec Jev et aucun accès gratuit à celui-ci.
Le dépôt jeeves de PostHog, mis à jour le 29 septembre, ajoute le raisonnement à ce schéma. Jeeves est un modèle de 9B proche de Jev, bâti sur Qwen3.5-9B avec LoRA et une tête de pointeur, entraîné avec SFT et CISPO. Il annonce 0,889 au global sur un split de test tenu à l'écart, contre 0,857 pour Jev et 0,822 pour Kev-9B, et 0,935 sur les niveaux publics de JevBench contre 0,866 pour Jev. Le raisonnement coûte du temps : environ 3,3 secondes en médiane par requête sur un H100 en fp8, contre 0,3 seconde sans lui.
Les chiffres ne vont pas tous dans le même sens. Jeeves bat Jev au global mais perd sur Transfer (0,746 contre 0,800) et sur MMLU-Pro 10-way (0,739 contre 0,840). Il répond aussi à 5,5 % des questions sans réponse possible avec p ≥ 0,9, mieux que les 9,0 % de Jev mais moins bien que les 0,0 % de Kev-9B.
Les prévisions de marché pour la catégorie varient fortement, ce qu'il vaut mieux signaler que moyenner. MarketsandMarkets situe le marché des SLM à 0,93 milliard USD en 2025, pour atteindre 5,45 milliards USD en 2032 à un TCAC de 28,7 %, tandis que wizr.ai cite un chiffre de 7,76 milliards USD en 2023, en croissance de 15,6 % de 2024 à 2030. Les deux estimations décrivent des marchés de tailles différentes.
Ce que suggère la paire de sorties du 29 septembre est plus étroit et plus concret : pour les tâches de classification, le format de sortie lui-même est repensé autour des probabilités, pas de la prose.
Sources
6- 01d1: Liquid AI's First Decision ModelEN
- 02Qevi-2B: A Jev-style finetuned model for image classificationEN
- 03Jeeves. Reasoning improves Jev-like decision modelsEN
- 04Language Models for Text Classification: From Bag-of-Words to JevEN
- 05Small Language Model Development: Lower Cost, More PrivacyEN
- 06The Rise of Small Language Models in Enterprise AI Adoption [2026]EN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.