Les petits modèles passent en local : Liquid AI livre d1, Qevi-2B lit les logits au lieu de parler
Liquid AI a publié le 29 septembre la documentation de d1, un modèle de décision qui renvoie des probabilités calibrées sur un ensemble fixe de résultats, en un seul appel et sans générer un seul token. Le même jour, un modèle de vision de 2B appelé Qevi-2B est apparu sur Hugging Face, avec une lecture de logits à la place de la génération de texte.

La documentation de d1 est arrivée le 29 septembre. Liquid AI y décrit une classe de modèles qui n'écrivent jamais une phrase. Le modèle prend un état, du texte ou un objet JSON, et une ou plusieurs questions typées, puis renvoie des probabilités. Trois types de questions sont pris en charge : noul pour oui/non, choice pour choisir une option parmi plusieurs, et score pour une grille ordonnée. Une question à trois niveaux peut ainsi ressortir à 1,85 entre Medium et High. « Les modèles de décision sont une nouvelle classe de modèles d'IA conçus spécialement pour des décisions structurées », indique la page.
Ce positionnement n'est pas propre à Liquid. Le mardi 29 septembre a aussi vu arriver Qevi-2B, un fine-tuning complet de Qwen3-VL-2B-Instruct publié par MeerDevelopment sur Hugging Face. Ce modèle répond à des questions fermées sur des images en lisant ses propres logits. Demandez-lui si une photo contient une échelle et il renvoie P(Yes) = 0,97, pas une phrase. La fiche du modèle annonce une exactitude de 0,977 en domaine contre 0,855 pour le Qwen3-VL-2B de base, une exactitude de 0,889 sur un domaine tenu à l'écart contre 0,745, et une erreur de calibration attendue sur ces données de 0,054 contre 0,160. Elle revendique aussi une inférence jusqu'à environ 21 fois plus rapide lorsqu'on pose beaucoup de questions sur une même image.
Pourquoi ce sont les petits qui sont intéressants
L'économie du problème compte plus que l'architecture. Evan Schwartz, qui anime un fil de contenu personnalisé appelé Scour, a écrit le 29 septembre qu'il envoie 54 questions (50 nouls, 3 choices, 1 score) sur environ 1,1 million de documents par mois. Son jeu de questions fait à peu près 2 150 tokens et représente près de 88 % des tokens d'entrée par requête, parce que les questions sont renvoyées mot pour mot à chaque fois. Sa facture totale reste sous 150 dollars par mois, ce qu'un LLM généraliste ne pourrait pas suivre sur ce volume selon lui. Il demande aux laboratoires d'ajouter la mise en cache des prompts ou des jeux de questions réutilisables, et renvoie à une demande ouverte sur le dépôt du SDK TypeSafe.
D'autres ont déjà bricolé des contournements. Un projet appelé Jeb, mis en ligne sur GitHub le 29 septembre, transforme n'importe quel point d'accès compatible OpenAI en service de décision de style Jev. Il lit les probabilités des tokens et renvoie du JSON structuré sur POST /v1/systemone. Son README est direct sur la dépendance : une API peut être compatible OpenAI pour le chat ordinaire tout en n'exposant pas les logprobs dont Jeb a besoin, il faut donc vérifier cette capacité avant de choisir un fournisseur. PostHog a publié Jeeves le même jour, un modèle Qwen3.5-9B de 9B avec du LoRA et une tête de pointage qui raisonne avant de décider, plus un drafter de diffusion par blocs de 4. Il annonce 0,889 sur son propre jeu de test tenu à l'écart contre 0,857 pour Jev et 0,822 pour Kev-9B, et 0,935 sur les paliers publics de JevBench contre 0,866 pour Jev. Le chiffre de 0,3 s par requête s'entend sans réflexion ; avec réflexion, la médiane monte à 3,3 s sur un seul H100 en fp8.
Un point de vigilance est venu de Casco le 28 septembre. La société de sécurité a passé 2 449 constats dans huit modèles, dont Jev, Claude et GPT, en demandant à chacun de choisir les huit métriques de base CVSS 3.1. Tous les modèles ont obtenu une meilleure moyenne que la référence publiée par Casco. Jev a attribué 550 notes critiques à un jeu de données qui contient 55 constats critiques publiés. GPT-6 Astra affichait l'erreur absolue moyenne la plus faible, à 1,92 point ; Jev se classait septième à 3,40. La sortie structurée ne s'est pas traduite par un meilleur jugement de gravité.
Ailleurs, le 29 septembre, Sebastian Raschka a publié une longue histoire technique de la classification de texte qui tente de replacer Jev dans son contexte. Il rappelle que le sac de mots avec un Bayes naïf remonte au moins à 1961 et que même le filtre anti-spam d'origine de Gmail l'aurait utilisé. Son évaluation reste mesurée : sur un problème étroit et bien défini, un modèle de style Jev ne battra probablement pas un classifieur spécialisé, mais il est bien plus général. Simple AI a profité de la journée pour lancer Tango, un modèle audio natif de détection de fin de tour. Selon l'entreprise, il arrive une médiane de 300 ms avant un détecteur d'activité vocale classique et se déclenche 3,7 à 4,7 fois moins souvent en pleine parole que Smart Turn à couverture égale des fins de tour. Sur le benchmark public LiveKit, il manque 15 des 400 vraies fins de tour, contre 54 pour Soniox et 197 pour Deepgram Flux.
Le fil conducteur, c'est que l'embarqué et l'étage des petits modèles sont là où le déploiement se fait réellement, et où se tiennent désormais les débats sur la mesure. La fiche de Qevi-2B précise que ses chiffres ne se reproduisent qu'avec la lecture des logits, pas via .generate() : « Si vous appelez .generate() et analysez le texte, vous ne les reproduirez pas, car ce n'est pas le chemin sur lequel le modèle a été affiné. » C'est un avertissement utile pour quiconque évalue ces systèmes. Un modèle peut sembler moins bon qu'il ne l'est simplement parce qu'on lui demande de parler.
Sources
12- 01d1: Liquid AI's First Decision ModelEN
- 02Qevi-2B: A Jev-style finetuned model for image classificationEN
- 03Please add prompt caching to Jev-style modelsEN
- 04Jeb: Turn any OpenAI API into a decision modelEN
- 05Jeeves. Reasoning improves Jev-like decision modelsEN
- 06Every model (incl. Jev) we tested inflates security finding severityEN
- 07Language Models for Text Classification: From Bag-of-Words to JevEN
- 08Tango: Simple AI's Conversational Awareness ModelEN
- 09The System One models ecosystemEN
- 10AI models keep posting screenshots showing sensitive data from inside tech companiesEN
- 11OpenAI announces 'dots' agent after scrapping launch of new AI model over safety concernsEN
- 12Language Models Act on Hidden ValenceEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.