Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Les petits modèles de décision passent sur l'appareil : d1 de Liquid AI, les clones de Jev et un classifieur visuel de 2B

Liquid AI a publié le 29 septembre la documentation de d1, son premier « modèle de décision ». Il appartient à une famille de petits modèles embarqués en pleine croissance, qui renvoient des probabilités calibrées au lieu de texte généré.

IA & modèlesActualitéSophie LeclercPublié le: 29 septembre 20265 min de lectureSources 12
Les petits modèles de décision passent sur l'appareil : d1 de Liquid AI, les clones de Jev et un classifieur visuel de 2B

La documentation décrit trois types de questions. Noul est une question oui/non qui renvoie une probabilité entre 0 et 1. Choice demande de choisir une option parmi plusieurs et renvoie une distribution sur des options nommées. Score renvoie une grille ordonnée sous forme de position pondérée par la probabilité. L'appel d'exemple envoie une réclamation client au modèle « d1:free » et renvoie 0.999 à la question « Is this message a complaint from the customer? ».

Ce n'est pas un chatbot. Rien n'est généré. La documentation de Liquid indique qu'un modèle de décision « évalue une situation et renvoie des probabilités calibrées sur un ensemble fixe de résultats en un seul appel, sans aucun token généré ». Plusieurs questions peuvent porter sur le même état dans une seule requête.

Pourquoi cette classe de modèles existe

Le même schéma apparaît dans les sources les plus récentes du dossier. Sebastian Raschka a publié le 29 septembre une longue explication technique sur la classification de texte, des sacs de mots aux RNN, aux CNN et aux transformeurs jusqu'à ce qu'il appelle des « API de type Jev ». Il soutient que l'intérêt tient au coût et à la vitesse plutôt qu'à la précision brute. « L'avantage de Jev, c'est qu'il peut traiter ces tâches de classification beaucoup plus vite et à moindre coût », écrit-il. Il avertit toutefois que pour un problème étroit et bien défini, un classifieur conçu sur mesure l'emportera encore sur les trois critères.

Le dépôt Jeeves de PostHog, également publié le 29 septembre, chiffre le compromis. Jeeves est un modèle de type Jev de 9B construit sur Qwen3.5-9B avec LoRA et une tête pointeur. Il a été entraîné avec SFT et CISPO à raisonner avant de décider. Le dépôt annonce 0.889 sur son propre échantillon de test retenu, contre 0.857 pour Jev et 0.822 pour Kev-9B, et 0.935 sur les paliers publics de JevBench contre 0.866 pour Jev. L'inférence tourne à environ 0.3 seconde par requête sans réflexion, et à une médiane de 3.3 secondes avec, sur un seul H100 en fp8. Elle tourne aussi sur Apple Silicon en bf16 ou FP8, et exige 48GB ou plus.

Evan Schwartz, qui dirige le fil de contenu personnalisé Scour, a publié le 29 septembre une demande de mise en cache des prompts pour cette classe d'API. Son jeu de questions compte désormais 54 questions (50 nouls, 3 choices, 1 score) pour environ 2 150 tokens, dont environ 260 tokens de surcoût fixe. Envoyées telles quelles à chaque requête sur environ 1 100 000 documents par mois, ces questions représentent près de 88 % de ses tokens d'entrée. Sa facture reste sous 150 $ par mois, mais il estime que la mise en cache rendrait les traitements par lots encore moins chers.

Le versant embarqué : un classifieur visuel de 2B

La sortie de petit modèle la plus nette du lot est Qevi-2B, publiée sur Hugging Face le 29 septembre. Il s'agit d'un fine-tuning complet de Qwen3-VL-2B-Instruct. Le modèle répond à des questions fermées sur des images en lisant ses propres logits plutôt qu'en générant du texte. Demandez-lui si une image contient une échelle et il renvoie P(Yes) = 0.97, pas une phrase.

La fiche du modèle annonce une précision en domaine passant de 0.855 pour le modèle de base à 0.977, une précision hors domaine de 0.745 à 0.889, et une erreur de calibration attendue sur les données retenues qui tombe de 0.160 à 0.054. L'inférence est donnée comme jusqu'à environ 21 fois plus rapide lorsqu'on pose beaucoup de questions sur une seule image. La fiche précise que le modèle doit être utilisé via une lecture de logits et non par .generate(). Elle ajoute que les trois types de questions pris en charge peuvent partager un même encodage de l'image, isolés par un masque d'attention bloc-diagonal, les réponses étant vérifiées bit à bit par rapport à un questionnement séparé.

Une évaluation du dossier va à l'encontre de cet enthousiasme. Casco, une entreprise de sécurité, a fait passer 2 449 constats dans huit modèles, dont Jev, Claude et GPT, et a comparé leurs scores CVSS 3.1 aux siens, publiés. Tous les modèles ont obtenu en moyenne un score supérieur à la référence. Jev a attribué 550 scores critiques à un jeu de données qui contient 55 constats critiques publiés, et 500 de ces 550 étaient sous le seuil critique dans la référence de Casco. En erreur absolue moyenne, GPT-6 Astra se classe premier à 1.92 point et Jev septième à 3.40. Le compte rendu de Casco est daté du 28 septembre.

Ailleurs dans ce même lot du 29 septembre, le thème du petit modèle surgit à des endroits moins évidents. Un modèle d'aperçu gratuit listé sur OpenRouter le 24 septembre sous le nom space-bunny-alpha revendique un contexte d'un million de tokens. Il indique utiliser environ un tiers des tokens de sortie de Qwen3.8 Flash sur les mêmes benchmarks, 305 989 contre 913 989, selon son propre site. Simple AI a lancé Tango, un modèle audio-natif de détection de fin de tour. Tango revendique une décision médiane 300ms avant qu'un détecteur classique d'activité vocale ne repère une pause, et 15 fins de tour manquées sur 400 au benchmark public LiveKit, contre 54 pour Soniox et 197 pour Deepgram Flux. Ce sont des comparaisons menées par les éditeurs sur un benchmark public, pas des audits indépendants.

Deux autres sorties de la fenêtre poussent dans la même direction : Jeb, un projet GitHub qui transforme n'importe quelle API compatible OpenAI en modèle de décision, et DesktopBrain, un organiseur de fichiers embarqué pour Mac. Ni l'un ni l'autre ne publie de chiffres de benchmark dans les éléments disponibles.

Le schéma est cohérent. Les petits modèles intéressants des dernières 72 heures ne sont pas des chatbots miniatures. Ils sont étroits, calibrés et peu coûteux à exécuter là où un modèle de frontière serait absurde : un téléphone, un ordinateur portable, un encodeur visuel de 2B, un classifieur qui répond à 54 questions pour moins de 150 $ par mois. Savoir s'ils sont assez précis pour le travail auquel on les destine est une autre question, et le résultat de Casco suggère que la réponse n'est pas toujours oui.

Commentaires 0

Sources

12
  1. 01d1: Liquid AI's First Decision ModelEN
  2. 02Qevi-2B: A Jev-style finetuned model for image classificationEN
  3. 03Language Models for Text Classification: From Bag-of-Words to JevEN
  4. 04Jeeves. Reasoning improves Jev-like decision modelsEN
  5. 05Every model (incl. Jev) we tested inflates security finding severityEN
  6. 06Please add prompt caching to Jev-style modelsEN
  7. 07Space-bunny-alpha a reasoning model from an anonymous providerEN
  8. 08Tango: Simple AI's Conversational Awareness ModelEN
  9. 09Jeb: Turn any OpenAI API into a decision modelEN
  10. 10DesktopBrain - AI File Organizer for Mac and All Folders - Private On-Device AIEN
  11. 11Language Models Act on Hidden ValenceEN
  12. 12Needed 1+1, built a functional programming languageEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.