Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Les petits modèles de décision passent en local, portés par les moteurs de type Jev

Liquid AI a publié le 29 septembre la documentation de d1, son premier modèle de décision. L'API renvoie des probabilités calibrées sur des issues fixes, en un seul appel et sans générer le moindre token. Le même jour, une publication sur Hugging Face montrait un modèle de vision de 2B lisant ses propres logits en local.

IA & modèlesAnalyseCamille RousseauPublié le: 29 septembre 20264 min de lectureSources 10
Les petits modèles de décision passent en local, portés par les moteurs de type Jev

La documentation de d1, chez Liquid AI, est parue le 29 septembre. Elle découpe chaque requête en trois formes typées : un noul (une question oui/non qui renvoie une probabilité entre 0 et 1), un choice (une distribution à choix unique sur des options nommées) et un score (une position pondérée par une probabilité sur une grille ordonnée). Les documents donnent un exemple où une réclamation client renvoie 0,999 sur une porte noul. Ils précisent aussi qu'une même requête peut porter plusieurs questions évaluées d'un coup. C'est la forme que le camp du calcul local attendait.

Sur un téléphone ou un ordinateur portable, l'intérêt tient à l'arithmétique. Un modèle qui sort un nombre au lieu d'un paragraphe saute toute la boucle de décodage : la latence cesse de croître avec la longueur de la réponse. La sortie devient aussi comparable à un seuil. Une probabilité de 0,92 est une condition de branchement, pas quelque chose qu'un analyseur doit interpréter.

Qevi-2B, publié sur Hugging Face le 29 septembre, est l'exemple le plus net de petit modèle. C'est un fine-tune complet de Qwen3-VL-2B-Instruct. Il répond à des questions typées et fermées sur des images en lisant les logits de la tête LM à la position de réponse, sans générer de texte. La fiche du modèle annonce une exactitude en domaine de 0,977 contre 0,855 pour le Qwen3-VL-2B de base, une exactitude de 0,889 sur un domaine tenu à l'écart contre 0,745, et une erreur de calibration attendue sur les données tenues à l'écart de 0,054 contre 0,160.

La fiche ne cache pas le piège. Les chiffres ne se reproduisent qu'avec une lecture des logits, une trentaine de lignes de code transformers ordinaire. Un appel à .generate() ne donnera pas les mêmes résultats, car ce n'est pas le chemin sur lequel le modèle a été affiné. La fiche prévient aussi que le modèle n'est pas un modèle de conversation. Demandez-lui s'il y a une échelle sur l'image : il renvoie P(Yes) = 0,97, pas une phrase. Le gain annoncé atteint environ 21 fois plus d'inférence rapide lorsqu'on pose beaucoup de questions sur une seule image. Trois questions distinctes peuvent en effet partager un même encodage et être isolées par un masque d'attention en blocs diagonaux, vérifié bit à bit par rapport à des questions posées séparément. L'entraînement a porté sur 57 000 questions noul et 28 500 questions choice.

Le raisonnement remet les petits modèles dans la course

L'objection évidente porte sur l'exactitude. Les classifieurs de type Jev sont bon marché et calibrés, mais, comme le note une implémentation, ils sont faibles à basse exactitude. C'est pourquoi les pipelines gardent un modèle de raisonnement en secours. Le dépôt Jeeves de PostHog, poussé le 29 septembre, s'attaque directement au problème : un modèle de type Jev de 9B (Qwen3.5-9B, LoRA, tête pointeur) qui réfléchit avant de décider, entraîné avec SFT et CISPO, plus un draft diffusion par blocs de 4. Le tableau publié place Jeeves à 0,889 sur les données de test tenues à l'écart, contre 0,857 pour Jev et 0,822 pour Kev-9B. Sur les paliers publics de JevBench, il est à 0,935 contre 0,866 pour Jev. Il annonce environ 0,3 s par requête sans réflexion et une médiane de 3,3 s avec, sur un seul H100 en fp8. Il tourne aussi sur Apple Silicon en bf16 ou FP8.

L'histoire de la classification de texte publiée par Sebastian Raschka le 29 septembre cadre toute cette vague. Elle retrace le chemin des sacs de mots et du Bayes naïf aux RNN et aux transformers, jusqu'à ce qu'il appelle les API de type Jev. Raschka soutient que l'avantage de Jev tient à la vitesse et au coût sur la classification, pas à la capacité brute. Evan Schwartz, écrivant le même jour, rend le cas du déploiement concret : il fait tourner 54 questions sur environ 1,1 million de documents par mois sur Scour, ses questions représentent à peu près 88 % des tokens d'entrée, et sa facture totale reste sous 150 $ par mois. Il demande aux fournisseurs de la mise en cache des prompts ou des ensembles de questions réutilisables.

Tout le monde n'est pas convaincu que les sorties soient fiables. Casco a testé huit modèles sur 2 449 constats de sécurité face à ses propres scores CVSS 3.1 publiés. Tous surestimaient la gravité. Jev a attribué 550 scores critiques à un jeu de données qui n'en contenait que 55 publiés, avec une erreur signée moyenne de +3,30 points. GPT-6 Astra était le plus précis, à 1,92 point d'erreur absolue moyenne, Jev arrivant septième à 3,40. Le même risque de surdiagnostic vaut pour toute porte locale qui se déclenche sur un seuil.

L'infrastructure suit. Le blog développeur de Microsoft soutenait le 29 septembre que les benchmarks publics de code ne prédisent pas la performance sur votre propre base de code. C'est le même argument que pour évaluer un petit modèle de décision sur vos propres entrées. JuliaHub rapportait le même jour qu'en changeant le harnais d'agent, à modèle fixe, les scores passaient de 0,533 à 0,899, soit plus du double de l'écart mesuré entre quatre modèles de frontière. Tuneloop a chiffré l'évaluation elle-même : 30 tâches rejouées et environ 55 $ fixent l'écart à plus ou moins 6 points, assez pour justifier de router le travail de routine vers un modèle moins cher à 2,5 % du coût. Pour un classifieur local, c'est le test qui décide si le petit modèle part en production.

Commentaires 0

Sources

10
  1. 01d1: Liquid AI's First Decision ModelEN
  2. 02Qevi-2B: A Jev-style finetuned model for image classificationEN
  3. 03Jeeves. Reasoning improves Jev-like decision modelsEN
  4. 04Language Models for Text Classification: From Bag-of-Words to JevEN
  5. 05Please add prompt caching to Jev-style modelsEN
  6. 06Every model (incl. Jev) we tested inflates security finding severityEN
  7. 07What AI benchmarks are not telling youEN
  8. 08The Best AI Models Fail at Physics: Coding Harnesses are to BlameEN
  9. 09How many tasks does it take to trust a cheaper model?EN
  10. 10Tango: Simple AI's Conversational Awareness ModelEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.