I piccoli modelli decisionali arrivano on-device mentre i runner in stile Jev si moltiplicano
Il 29 settembre Liquid AI ha pubblicato la documentazione di d1, il suo primo modello decisionale: un'API che restituisce probabilità calibrate su esiti fissi con una sola chiamata e zero token generati. Lo stesso giorno, un rilascio su Hugging Face ha mostrato un modello visivo da 2B che legge i propri logit on-device.

La documentazione di d1 di Liquid AI è comparsa il 29 settembre. Ogni query finisce in una di tre forme tipizzate: un noul (una domanda sì/no che restituisce una probabilità tra 0 e 1), una choice (una distribuzione a scelta singola su opzioni denominate) e uno score (una posizione ponderata per probabilità su una rubrica ordinata). I documenti riportano un esempio in cui un reclamo di un cliente restituisce 0,999 su un gate noul, e osservano che la stessa richiesta può contenere più domande valutate insieme. È la forma che l'ambiente on-device aspettava.
Il motivo per cui conta su un telefono o un portatile è aritmetico. Un modello che emette un numero invece di un paragrafo di testo salta del tutto il ciclo di decodifica, così la latenza smette di crescere con la lunghezza della risposta. L'output diventa anche una soglia: una probabilità di 0,92 è una condizione di diramazione, non qualcosa che un parser deve interpretare.
Qevi-2B, rilasciato su Hugging Face il 29 settembre, è l'esempio più chiaro di modello piccolo. È un fine-tune completo di Qwen3-VL-2B-Instruct che risponde a domande chiuse e tipizzate sulle immagini leggendo i logit della LM-head nella posizione della risposta invece di generare testo. La model card riporta un'accuratezza in-domain di 0,977 contro 0,855 del Qwen3-VL-2B di base, un'accuratezza su dominio tenuto fuori di 0,889 contro 0,745, e un errore di calibrazione atteso sui dati tenuti fuori di 0,054 contro 0,160.
La card è schietta sul punto debole: i numeri si riproducono solo attraverso una lettura dei logit, circa 30 righe di normale codice transformers, e chiamare .generate() non li eguaglierà perché non è il percorso su cui il modello è stato messo a punto. Avverte anche che il modello non è un modello conversazionale. Chiedete se nell'immagine c'è una scala e restituisce P(Yes) = 0,97, non una frase. Il guadagno dichiarato arriva fino a circa 21 volte in più di velocità di inferenza quando si pongono molte domande su una sola immagine: tre domande separate possono condividere una singola codifica ed essere isolate con una maschera di attenzione a blocchi diagonali, verificata bit per bit rispetto al porle separatamente. L'addestramento ha coperto 57.000 domande noul e 28.500 domande choice.
Il ragionamento rimette i modelli piccoli in gara
L'obiezione ovvia è l'accuratezza. I classificatori in stile Jev sono economici e calibrati ma, come nota un'implementazione, sono deboli a bassa accuratezza, ed è per questo che le pipeline tengono un modello di ragionamento come ripiego. Il repo Jeeves di PostHog, pubblicato il 29 settembre, attacca proprio questo punto: un modello simile a Jev da 9B (Qwen3.5-9B, LoRA, pointer head) che pensa prima di decidere, addestrato con SFT e CISPO, più un drafter a diffusione block-4. La tabella pubblicata mette Jeeves a 0,889 sui dati di test tenuti fuori contro 0,857 di Jev e 0,822 di Kev-9B, e a 0,935 contro 0,866 di Jev sui tier pubblici di JevBench. Riporta circa 0,3 s per richiesta senza ragionamento e una mediana di 3,3 s con esso su una H100 a fp8, e gira su Apple Silicon in bf16 o FP8.
La storia della classificazione del testo pubblicata da Sebastian Raschka il 29 settembre inquadra l'intera ondata. Traccia il percorso dal bag-of-words e dal naive Bayes attraverso RNN e transformer fino a quelli che chiama API in stile Jev, e sostiene che il vantaggio di Jev sta in velocità e costo sulla classificazione, non in capacità grezza. Evan Schwartz, scrivendo lo stesso giorno, rende concreto il caso del deployment: esegue 54 domande su circa 1,1 milioni di documenti al mese su Scour, le sue domande sono circa l'88% dei token di input, e la sua bolletta totale resta sotto i 150 dollari al mese. Chiede ai fornitori il prompt caching o set di domande riutilizzabili.
Non tutti sono convinti che gli output siano affidabili. Casco ha testato otto modelli su 2.449 risultati di sicurezza contro i propri punteggi CVSS 3.1 pubblicati e ha trovato che ogni modello sovrastimava la gravità. Jev ha assegnato 550 punteggi critici a un dataset che conteneva 55 risultati critici pubblicati, con un errore medio con segno di +3,30 punti; GPT-6 Astra è stato il più accurato con 1,92 punti di errore medio assoluto, con Jev settimo a 3,40. Lo stesso rischio di sovradiagnosi vale per qualsiasi gate on-device che scatta su una soglia.
L'infrastruttura segue. Il blog per sviluppatori di Microsoft ha sostenuto il 29 settembre che i benchmark pubblici di programmazione non predicono le prestazioni sul proprio codice, che è lo stesso argomento per valutare un piccolo modello decisionale sui propri input. JuliaHub ha riportato lo stesso giorno che cambiare l'agent harness, tenendo fisso il modello, ha spostato i punteggi da 0,533 a 0,899, più del doppio del divario misurato tra quattro modelli di frontiera. Tuneloop ha quantificato la valutazione stessa: 30 attività riprodotte e circa 55 dollari fissano il divario a più o meno 6 punti, abbastanza per giustificare l'instradamento del lavoro di routine verso un modello più economico al 2,5% del costo. Per un classificatore on-device, è il test che decide se il modello piccolo va in produzione.
Fonti
10- 01d1: Liquid AI's First Decision ModelEN
- 02Qevi-2B: A Jev-style finetuned model for image classificationEN
- 03Jeeves. Reasoning improves Jev-like decision modelsEN
- 04Language Models for Text Classification: From Bag-of-Words to JevEN
- 05Please add prompt caching to Jev-style modelsEN
- 06Every model (incl. Jev) we tested inflates security finding severityEN
- 07What AI benchmarks are not telling youEN
- 08The Best AI Models Fail at Physics: Coding Harnesses are to BlameEN
- 09How many tasks does it take to trust a cheaper model?EN
- 10Tango: Simple AI's Conversational Awareness ModelEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.