Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Les modèles de décision passent au format réduit : Qevi-2B, Liquid d1 et Jeeves poussent la classification en local

Un modèle de vision à 2B de paramètres qui répond par oui ou non en lisant ses propres logits, sans générer de texte, a été publié sur Hugging Face le 29 septembre. Il revendique une exactitude de 0,977 en domaine et une inférence jusqu'à 21 fois plus rapide quand plusieurs questions portent sur une même image.

IA & modèlesActualitéCamille RousseauPublié le: 29 septembre 20266 min de lectureSources 12
Les modèles de décision passent au format réduit : Qevi-2B, Liquid d1 et Jeeves poussent la classification en local

Le modèle s'appelle Qevi-2B. C'est un ajustement complet de Qwen3-VL-2B-Instruct, et ses auteurs le présentent comme « pas un modèle de conversation » : demandez si une échelle se trouve sur une photo, il renvoie P(Oui) = 0,97 au lieu d'une phrase. La fiche publiée donne une exactitude de 0,977 en domaine contre 0,855 pour le modèle de base, 0,889 contre 0,745 sur des domaines tenus à l'écart, et une erreur de calibration attendue de 0,054 contre 0,160 sur ces mêmes données. L'argument de vitesse repose sur le regroupement des questions. Plusieurs questions partagent un seul encodage de l'image, isolées par un masque d'attention en bloc diagonal. Le procédé a été vérifié bit à bit par rapport à un envoi séparé.

Voilà un artefact parmi d'autres dans une catégorie vieille de quinze jours, qui compte désormais des SDK, des bancs d'essai, une suite concurrente et au moins un clone open source. TypeSafe a livré Jev le 15 septembre, selon Casco, qui estime que le modèle est devenu un mème « en quarante-huit heures ».

Liquid met un nom sur les primitives

Liquid AI a publié le 29 septembre la documentation de d1, qu'elle présente comme son premier modèle de décision. Les documents sont étonnamment explicites sur la finalité de ces systèmes : au lieu de générer des tokens un par un, un modèle de décision évalue un état et renvoie des probabilités calibrées sur un ensemble fixe de résultats « en un seul appel, sans aucun token généré ».

Liquid définit trois types de questions devenus l'interface de fait. Noul est une question fermée qui renvoie une probabilité entre 0 et 1 ; la documentation prend l'exemple d'un contrôle de spam qui retourne 0,92. Choice renvoie une distribution sur des options nommées, par exemple {"billing": 0.65, "technical": 0.30, "account": 0.05} pour le routage des tickets. Score renvoie une position pondérée par les probabilités sur une grille ordonnée : à la question « quelle est l'urgence ? » sur trois niveaux, la réponse peut être 1,85, entre Medium et High. Liquid conseille de choisir le type selon ce que fait le code ensuite. Un embranchement sur une catégorie appelle Choice, une comparaison à un seuil appelle Score, une condition booléenne appelle Noul.

L'entreprise met aussi en garde contre une confusion fréquente. Un noul à 0,5, selon la documentation, signifie une incertitude maximale entre oui et non et « ne dit rien du degré ni de l'intensité ». Mesurer un degré demande un Score avec des niveaux définis.

Jeeves : du raisonnement par-dessus, et une facture de 3,3 secondes

La critique la plus intéressante de la catégorie vient de PostHog, qui a publié Jeeves le 29 septembre : un modèle de 9B proche de Jev, bâti sur Qwen3.5-9B avec LoRA et une tête de pointage, entraîné par SFT et CISPO pour raisonner avant de décider. Le dépôt ne mâche pas le compromis qu'il corrige. « Les modèles de type Jev donnent des probabilités de décision calibrées, mais avec une faible exactitude », indique le README, ce qui explique pourquoi beaucoup de pipelines se rabattent déjà sur un modèle de raisonnement.

Jeeves annonce 0,889 sur un découpage de test tenu à l'écart et hors domaine de 2 962 éléments, contre 0,857 pour Jev et 0,822 pour Kev-9B. Réserve : les colonnes Kev et Jev sont des chiffres publiés par Kev. Sur les 231 éléments publics de JevBench, il revendique 0,935 contre 0,866 pour Jev ; sur le palier difficile de 111 éléments, 0,865 contre 0,730. Son erreur de calibration sur les éléments publics de JevBench est de 0,037. Le même point de contrôle obtient 0,804 sans réflexion contre 0,840 avec.

Vient le coût. PostHog mesure environ 0,3 seconde par requête sans réflexion et une médiane de 3,3 secondes avec, sur un seul H100 en précision FP8, et note que tronquer la chaîne raccourcit ce délai. L'inférence tourne aussi sur Apple Silicon avec 48 Go ou plus, ce qui compte si l'intérêt d'un petit modèle de décision est de garder le travail en local.

Les chiffres des modèles de base dans le tableau de Jeeves ne sont pas tous comparables : le dépôt marque son résultat Kev-9B sur JevBench d'un astérisque précisant qu'aucun résultat Kev-9B sur JevBench n'est publié et que les chiffres affichés sont ceux de Kev-8B sur Qwen3.

Qui paie vraiment pour un classifieur

L'argument de production le plus clair vient d'Evan Schwartz, qui dirige Scour, un fil de contenu personnalisé. Dans une publication du 29 septembre, il raconte poser 54 questions à environ 1 100 000 documents par mois : 50 nouls, 3 choices et 1 score, soit environ 2 150 tokens dont à peu près 260 tokens de surcoût fixe. Ses questions représentent désormais près de 88 % des tokens d'entrée, envoyées telles quelles à chaque requête. Sa dépense totale reste sous 150 dollars par mois, et il affirme que faire passer le même contenu par le moins cher des LLM serait hors de portée pour un projet bootstrappé.

Sa demande est précise : de la mise en cache de prompt, ou la possibilité d'enregistrer des jeux de questions réutilisables.

Il précise qu'il ne regroupe pas plusieurs publications par requête, à cause de l'avertissement documenté selon lequel l'exactitude baisse quand l'état grossit avec du contenu sans rapport. Il suggère une API acceptant beaucoup de questions et beaucoup d'entrées, qui éviterait la pénalité du regroupement. D'autres comblent déjà les trous autour de TypeSafe. Un projet GitHub nommé Jeb, mis à jour le 29 septembre, transforme n'importe quel point d'accès compatible OpenAI en modèle de décision en lisant les logprobs des tokens et en renvoyant du JSON structuré sur POST /v1/systemone, avec le même format de requête en ligne de commande. Son README est franc sur le prérequis : un point d'accès peut être compatible OpenAI pour une conversation ordinaire tout en n'exposant pas les probabilités logarithmiques dont Jeb a besoin. Mieux vaut donc vérifier cette capacité avant de choisir un fournisseur.

Le problème des bancs d'essai arrive tôt

Casco, une entreprise de sécurité, a fait passer 2 449 constats à huit modèles, dont Jev, Claude et GPT, en comparant les scores de gravité CVSS 3.1 à ses propres références publiées. Tous les modèles ont surestimé en moyenne. Jev a attribué 550 scores critiques à un jeu de données contenant 55 constats critiques publiés, dont 500 des 550 sous le seuil critique dans la référence de Casco. GPT-6 Astra s'est montré le plus exact au global, avec 1,92 point d'erreur absolue moyenne ; Jev se classe septième à 3,40, devant Haiku à 3,94.

Les erreurs signées pointent toutes dans le même sens : Jev +3,30 points, Haiku +3,89, Astra +1,18, sur une échelle de dix points. Pour Casco, une sortie structurée et calibrée n'a pas rendu les jugements de gravité plus exacts face à sa référence, et le « security slop » qui en résulte coûte du temps aux ingénieurs. L'étude a utilisé les mêmes éléments de preuve pour chaque modèle, sans la politique de notation de Casco ni le contexte applicatif interne. Elle mesure donc le jugement et non l'arithmétique.

Reste une question de maintenance que personne n'a tranchée. Jeeves est un ajustement de Qwen3.5-9B avec un rédacteur par diffusion et une API compatible Jev ; Qevi-2B est un ajustement de Qwen3-VL-2B. Tous deux dépendent de modèles de base qui seront remplacés. La promesse de la catégorie est qu'on peut ajouter des questions sans réentraîner, ce qui vaut pour la surface d'API mais pas pour les poids.

Le 29 septembre, Sebastian Raschka a publié une longue histoire technique de la classification de texte, des sacs de mots aux RNN, aux CNN et aux transformeurs jusqu'à ce qu'il appelle les API de type Jev, explicitement pour « démystifier l'engouement ». Sa conclusion est la moins spectaculaire et sans doute la plus utile : sur un problème étroit et bien défini, un modèle de style Jev ne battra pas un classifieur spécialisé en exactitude, en vitesse ou en coût. Son atout est la généralité dans la fonction de classification, et c'est une revendication bien plus modeste que ne le laisse croire la réaction.

Commentaires 0

Sources

12
  1. 01Qevi-2B: A Jev-style finetuned model for image classificationEN
  2. 02d1: Liquid AI's First Decision ModelEN
  3. 03Jeeves. Reasoning improves Jev-like decision modelsEN
  4. 04Please add prompt caching to Jev-style modelsEN
  5. 05Jeb: Turn any OpenAI API into a decision modelEN
  6. 06Every model (incl. Jev) we tested inflates security finding severityEN
  7. 07Language Models for Text Classification: From Bag-of-Words to JevEN
  8. 08The System One models ecosystemEN
  9. 09AI models keep posting screenshots showing sensitive data from inside companiesEN
  10. 10AI Models Fail at Physics: Coding Harnesses Are to BlameEN
  11. 11How many tasks does it take to trust a cheaper model?EN
  12. 12Gates Foundation 5 Year Goal: Help 3B People to Use AI in Their LanguageEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.