Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

I modelli decisionali puntano al piccolo: Qevi-2B, Liquid d1 e Jeeves spingono la classificazione on-device

Un modello visivo da 2B parametri che risponde a domande sì/no leggendo i propri logit, invece di generare testo, è stato pubblicato su Hugging Face il 29 settembre. Dichiara una precisione di 0,977 in-domain e un'inferenza fino a 21 volte più veloce quando a una sola immagine si pongono molte domande.

IA e modelliNotiziaGiulia FerrariPubblicato: 29 settembre 20266 min di letturaFonti 12
I modelli decisionali puntano al piccolo: Qevi-2B, Liquid d1 e Jeeves spingono la classificazione on-device

Il modello si chiama Qevi-2B, un fine-tune completo di Qwen3-VL-2B-Instruct, e gli autori lo descrivono come "non un modello da chat": chiedi se in una foto c'è una scala e restituisce P(Yes) = 0,97 invece di una frase. La scheda pubblicata indica una precisione in-domain di 0,977 contro 0,855 del modello base, 0,889 contro 0,745 su domini tenuti fuori dall'addestramento e un errore di calibrazione atteso su dati held-out di 0,054 contro 0,160. Il vantaggio di velocità si basa sul question packing: più domande condividono una sola codifica dell'immagine, isolate da una maschera di attenzione a blocchi diagonali, verificata bit a bit rispetto alla formulazione separata delle stesse domande.

È un solo artefatto di una categoria che ha due settimane di vita e che ormai conta SDK, benchmark, una suite di benchmark rivale e almeno un clone open source. TypeSafe ha distribuito Jev il 15 settembre, secondo Casco, che ha misurato la scalata del modello allo stato di meme in "meno di quarantotto ore".

Liquid dà un nome alle primitive

Liquid AI ha pubblicato il 29 settembre la documentazione di d1, che definisce il suo primo modello decisionale. I documenti sono insolitamente espliciti su a cosa servono questi sistemi: invece di generare token uno alla volta, un modello decisionale valuta uno stato e restituisce probabilità calibrate su un insieme fisso di esiti "in una sola chiamata, con zero token generati".

Liquid definisce tre tipi di domanda diventati di fatto l'interfaccia standard. Noul è una domanda sì/no che restituisce una probabilità tra 0 e 1; la documentazione usa come esempio un controllo antispam che restituisce 0,92. Choice restituisce una distribuzione su opzioni denominate, per esempio {"billing": 0,65, "technical": 0,30, "account": 0,05} per l'instradamento dei ticket. Score restituisce una posizione ponderata per probabilità su una scala ordinata, così "quanto è urgente?" su tre livelli può tornare come 1,85, tra Medium e High. Il consiglio di Liquid è scegliere il tipo in base a ciò che il codice fa subito dopo: se devi diramare su una categoria, usa Choice; se devi confrontare con una soglia, usa Score; se devi aprire o chiudere un passaggio su un booleano, usa Noul.

L'azienda mette anche in guardia da una confusione frequente. Un noul a 0,5, secondo la documentazione, significa massima incertezza tra sì e no e "non dice nulla sul grado o sull'intensità". Per misurare il grado serve Score con livelli definiti.

Jeeves: ragionamento sopra, e un conto da 3,3 secondi

L'obiezione più interessante alla categoria arriva da PostHog, che il 29 settembre ha pubblicato Jeeves: un modello da 9B simile a Jev, costruito su Qwen3.5-9B con LoRA e una pointer head, addestrato con SFT e CISPO in modo da ragionare prima di decidere. Il repository è diretto sul compromesso che vuole correggere. "I modelli simili a Jev danno probabilità decisionali calibrate, ma con bassa precisione", dice il README, ed è per questo che molte pipeline ripiegano già su un modello di ragionamento.

Jeeves dichiara 0,889 su uno split di test held-out e out-of-domain di 2.962 elementi, contro 0,857 di Jev e 0,822 di Kev-9B, con l'avvertenza che le colonne Kev e Jev sono numeri pubblicati da Kev. Sui 231 elementi pubblici di JevBench dichiara 0,935 contro 0,866 di Jev; sul tier difficile da 111 elementi, 0,865 contro 0,730. Il suo errore di calibrazione sugli elementi pubblici di JevBench è 0,037. Lo stesso checkpoint segna 0,804 senza il pensiero e 0,840 con il pensiero.

Poi c'è il costo. PostHog misura circa 0,3 secondi per richiesta senza il pensiero e una mediana di 3,3 secondi con il pensiero, su una H100 a precisione FP8, e osserva che troncare la catena accorcia quel tempo. L'inferenza gira anche su Apple Silicon con 48GB o più, un dettaglio che conta se lo scopo di un piccolo modello decisionale è tenere il lavoro in locale.

I numeri dei modelli base nella tabella di Jeeves non sono tutti omogenei: il repository segna la sua cifra Kev-9B su JevBench con un asterisco, precisando che nessun risultato JevBench di Kev-9B è pubblicato e che i numeri mostrati sono quelli di Kev-8B su Qwen3.

Chi paga davvero per un classificatore

L'argomento produttivo più chiaro arriva da Evan Schwartz, che gestisce Scour, un feed di contenuti personalizzato. In un post del 29 settembre racconta di porre 54 domande su circa 1.100.000 documenti al mese: 50 noul, 3 choice e 1 score, per un totale di circa 2.150 token, di cui circa 260 token di overhead fisso. Le sue domande ormai rappresentano circa l'88% dei token di input, inviate alla lettera a ogni richiesta. La sua spesa totale è sotto i 150 dollari al mese, e dice che far passare gli stessi contenuti anche dal più economico degli LLM sarebbe proibitivo per un progetto autofinanziato.

La sua richiesta è precisa: il prompt caching, o la possibilità di registrare set di domande riutilizzabili.

Nota che non raggruppa più post per richiesta, per via dell'avvertenza documentata secondo cui la precisione cala quando lo stato cresce con contenuti non correlati, e propone come alternativa un'API che accetti molte domande e molti input, evitando così la penalità del packing. Altri stanno già riempiendo i vuoti attorno a TypeSafe. Un progetto GitHub chiamato Jeb, aggiornato il 29 settembre, trasforma qualsiasi endpoint compatibile con OpenAI in un modello decisionale leggendo i logprob dei token e restituendo JSON strutturato su POST /v1/systemone, con lo stesso formato di richiesta via CLI. Il suo README è schietto sul prerequisito: un endpoint può essere compatibile con OpenAI per la chat normale e mancare delle probabilità logaritmiche che Jeb richiede, quindi conviene verificare quella capacità prima di scegliere un provider.

Il problema dei benchmark arriva presto

Casco, un'azienda di sicurezza, ha fatto passare 2.449 risultati attraverso otto modelli, tra cui Jev, Claude e GPT, confrontando i punteggi di severità CVSS 3.1 con i propri riferimenti pubblicati. Tutti i modelli hanno sovrastimato in media. Jev ha assegnato 550 punteggi critici a un dataset che conteneva 55 risultati critici pubblicati, e 500 di quei 550 erano sotto la soglia critica nel riferimento di Casco. GPT-6 Astra è stato il più preciso nel complesso, con un errore assoluto medio di 1,92 punti; Jev si è classificato settimo con 3,40, davanti a Haiku con 3,94.

Gli errori con segno puntano tutti nella stessa direzione: Jev +3,30 punti, Haiku +3,89, Astra +1,18, su una scala da dieci punti. La lettura di Casco è che un output strutturato e calibrato non ha reso i giudizi di severità più accurati rispetto al suo riferimento, e che il conseguente "security slop" costa tempo agli ingegneri. Lo studio ha usato le stesse evidenze per ogni modello, senza la policy di scoring di Casco né il contesto applicativo interno, quindi misura il giudizio, non l'aritmetica.

C'è anche una questione di manutenzione a cui nessuno ha risposto. Jeeves è un fine-tune su Qwen3.5-9B con un diffusion drafter e un'API compatibile con Jev; Qevi-2B è un fine-tune di Qwen3-VL-2B. Entrambi dipendono da modelli base che verranno superati. La promessa della categoria è che puoi aggiungere domande senza riaddestrare: vero per la superficie dell'API, non per i pesi.

Il 29 settembre Sebastian Raschka ha pubblicato una lunga storia tecnica della classificazione testuale, dal bag-of-words attraverso RNN, CNN e transformer fino a quelli che chiama API simili a Jev, esplicitamente per "demistificare l'hype". La sua conclusione è la meno eccitante e probabilmente la più utile: su un problema ristretto e ben definito, un modello in stile Jev non batterà un classificatore specializzato in precisione, velocità o costo. Il suo punto di forza è la generalità dentro lo slot della classificazione, un'affermazione molto più piccola di quanto suggerisca la reazione.

Commenti 0

Fonti

12
  1. 01Qevi-2B: A Jev-style finetuned model for image classificationEN
  2. 02d1: Liquid AI's First Decision ModelEN
  3. 03Jeeves. Reasoning improves Jev-like decision modelsEN
  4. 04Please add prompt caching to Jev-style modelsEN
  5. 05Jeb: Turn any OpenAI API into a decision modelEN
  6. 06Every model (incl. Jev) we tested inflates security finding severityEN
  7. 07Language Models for Text Classification: From Bag-of-Words to JevEN
  8. 08The System One models ecosystemEN
  9. 09AI models keep posting screenshots showing sensitive data from inside companiesEN
  10. 10AI Models Fail at Physics: Coding Harnesses Are to BlameEN
  11. 11How many tasks does it take to trust a cheaper model?EN
  12. 12Gates Foundation 5 Year Goal: Help 3B People to Use AI in Their LanguageEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.