Piccoli modelli decisionali passano on-device: d1 di Liquid AI, i cloni di Jev e un classificatore visivo da 2B
Liquid AI ha pubblicato il 29 settembre la documentazione di d1, il suo primo "modello decisionale". Fa parte di una famiglia di piccoli modelli on-device in rapida crescita, che restituiscono probabilità calibrate invece di testo generato.

La documentazione descrive tre tipi di domanda. Noul è una domanda sì/no che restituisce una probabilità tra 0 e 1. Choice è una domanda a scelta singola tra più opzioni, e restituisce una distribuzione su opzioni denominate. Score è una rubrica ordinata, restituita come posizione ponderata per probabilità. La chiamata di esempio invia un reclamo di un cliente al modello "d1:free" e restituisce 0.999 alla domanda "Is this message a complaint from the customer?"
È una forma di modello diversa da un chatbot. Non viene generato nulla. Secondo la documentazione di Liquid, un modello decisionale "valuta una situazione e restituisce probabilità calibrate su un insieme fisso di esiti in una singola chiamata con zero token generati". Più domande possono essere valutate sullo stesso stato in una sola richiesta.
Perché esiste questa classe di modelli
Lo stesso schema ricorre in tutte le fonti più recenti del dossier. Il 29 settembre Sebastian Raschka ha pubblicato una lunga spiegazione tecnica che ripercorre la classificazione del testo dal bag-of-words alle RNN, alle CNN e ai transformer, fino a quelli che chiama "API simili a Jev". Secondo lui l'attrattiva sta nel costo e nella velocità, non nell'accuratezza grezza. "Il vantaggio di Jev è che può gestire quei compiti di classificazione molto più velocemente e a costi inferiori", scrive. Avverte però che per un problema ristretto e ben definito un classificatore costruito ad hoc vincerà comunque su tutti e tre i fronti.
Il repository Jeeves di PostHog, anch'esso pubblicato il 29 settembre, quantifica il compromesso. Jeeves è un modello da 9B simile a Jev, costruito su Qwen3.5-9B con LoRA e una pointer head, addestrato con SFT e CISPO per ragionare prima di decidere. Il repository riporta 0.889 sul proprio split di test held-out, contro 0.857 di Jev e 0.822 di Kev-9B, e 0.935 sui tier pubblici di JevBench contro 0.866 di Jev. L'inferenza gira a circa 0.3 secondi per richiesta senza thinking e a una mediana di 3.3 secondi con il thinking, su una H100 a fp8. Funziona anche su Apple Silicon in bf16 o FP8, e richiede 48GB o più.
Evan Schwartz, che gestisce il feed di contenuti personalizzati Scour, ha pubblicato il 29 settembre una richiesta di prompt caching per questa classe di API. Il suo insieme di domande ora conta 54 domande (50 noul, 3 choice, 1 score) per circa 2.150 token, di cui circa 260 token sono overhead fisso. Le invia alla lettera con ogni richiesta, su circa 1.100.000 documenti al mese, e le domande costituiscono circa l'88% dei suoi token di input. La sua bolletta è sotto i 150 dollari al mese, ma secondo lui il caching renderebbe i flussi di lavoro in batch ancora più economici.
Il versante on-device: un classificatore visivo da 2B
Il rilascio di piccolo modello più chiaro del gruppo è Qevi-2B, pubblicato su Hugging Face il 29 settembre. È un fine-tune completo di Qwen3-VL-2B-Instruct che risponde a domande chiuse sulle immagini leggendo i logit del modello stesso invece di generare testo. Se gli si chiede se in un'immagine c'è una scala, restituisce P(Yes) = 0.97, non una frase.
La model card riporta l'accuratezza in-domain che sale da 0.855 del modello base a 0.977, l'accuratezza held-out di dominio da 0.745 a 0.889, e l'errore di calibrazione atteso sui dati held-out che scende da 0.160 a 0.054. L'inferenza è indicata come fino a circa 21 volte più veloce quando si pongono molte domande su una sola immagine. La card è esplicita: il modello va usato tramite una lettura dei logit e non con .generate(). Tutti e tre i tipi di domanda supportati possono condividere una singola codifica dell'immagine, isolati da una maschera di attenzione a blocchi diagonali, con risposte verificate bit per bit rispetto a porle separatamente.
Una valutazione nel dossier va contro l'entusiasmo. Casco, un'azienda di sicurezza, ha analizzato 2.449 risultati con otto modelli tra cui Jev, Claude e GPT, e ha confrontato i loro punteggi CVSS 3.1 con i propri punteggi pubblicati. Ogni modello ha ottenuto in media un punteggio più alto del riferimento. Jev ha assegnato 550 punteggi critical a un dataset che conteneva 55 risultati critical pubblicati, e 500 di quei 550 erano sotto la soglia critical nel riferimento di Casco. Sull'errore assoluto medio, GPT-6 Astra si è classificato primo con 1.92 punti e Jev settimo con 3.40. Il resoconto di Casco è datato 28 settembre.
Altrove, nello stesso gruppo del 29 settembre, il tema dei piccoli modelli emerge in luoghi meno ovvi. Un modello di anteprima gratuito elencato su OpenRouter il 24 settembre come space-bunny-alpha dichiara un contesto da un milione di token. Secondo il suo stesso sito usa circa un terzo dei token di output di Qwen3.8 Flash sugli stessi benchmark, 305.989 contro 913.989. Simple AI ha lanciato Tango, un modello audio-nativo per il rilevamento di fine turno. Dichiara una decisione mediana 300ms prima che un rilevatore convenzionale di attività vocale individuerebbe una pausa, e 15 finali di turno mancati su 400 nel benchmark pubblico LiveKit, contro 54 di Soniox e 197 di Deepgram Flux. Sono confronti eseguiti dai fornitori su un benchmark pubblico, non audit indipendenti.
Altri due rilasci nella finestra spingono nella stessa direzione: Jeb, un progetto GitHub che trasforma qualsiasi API compatibile con OpenAI in un modello decisionale, e DesktopBrain, un organizzatore di file on-device per Mac. Nessuno dei due pubblica numeri di benchmark nel materiale disponibile.
Lo schema è coerente. I piccoli modelli interessanti delle ultime 72 ore non sono chatbot in miniatura. Sono ristretti, calibrati ed economici da eseguire dove un modello di frontiera sarebbe assurdo: un telefono, un laptop, un encoder visivo da 2B, un classificatore che risponde a 54 domande per meno di 150 dollari al mese. Se siano abbastanza accurati per il lavoro a cui sono destinati è una questione separata, e il risultato di Casco suggerisce che la risposta non è sempre sì.
Fonti
12- 01d1: Liquid AI's First Decision ModelEN
- 02Qevi-2B: A Jev-style finetuned model for image classificationEN
- 03Language Models for Text Classification: From Bag-of-Words to JevEN
- 04Jeeves. Reasoning improves Jev-like decision modelsEN
- 05Every model (incl. Jev) we tested inflates security finding severityEN
- 06Please add prompt caching to Jev-style modelsEN
- 07Space-bunny-alpha a reasoning model from an anonymous providerEN
- 08Tango: Simple AI's Conversational Awareness ModelEN
- 09Jeb: Turn any OpenAI API into a decision modelEN
- 10DesktopBrain - AI File Organizer for Mac and All Folders - Private On-Device AIEN
- 11Language Models Act on Hidden ValenceEN
- 12Needed 1+1, built a functional programming languageEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.