I modelli piccoli passano sul dispositivo: Liquid AI pubblica d1, Qevi-2B legge i logits invece di parlare
Liquid AI ha pubblicato il 29 settembre la documentazione di d1, un modello decisionale che restituisce probabilità calibrate su un insieme fisso di esiti in una sola chiamata, senza generare alcun token. Lo stesso giorno è apparso su Hugging Face Qevi-2B, un modello vision da 2B che risponde leggendo i logits invece di scrivere testo.

La documentazione di d1 di Liquid AI è uscita il 29 settembre. Descrive una classe di modelli che non scrive mai una frase. Prende uno stato (testo o un oggetto JSON) e una o più domande tipizzate, e restituisce probabilità. I tipi di domanda supportati sono tre: noul per sì/no, choice per scegliere una voce tra molte, e score per una scala ordinata, dove una domanda a tre livelli può tornare come 1,85 tra Medium e High. "I decision models sono una nuova classe di modelli AI progettati appositamente per le decisioni strutturate", si legge nella pagina.
Questa impostazione non è esclusiva di Liquid. Martedì 29 settembre è arrivato anche Qevi-2B, un fine-tune completo di Qwen3-VL-2B-Instruct pubblicato da MeerDevelopment su Hugging Face. Il modello risponde a domande chiuse sulle immagini leggendo i logits del modello stesso. Chiedigli se in una foto c'è una scala e restituisce P(Yes) = 0,97, non una frase. La model card riporta un'accuratezza in-domain di 0,977 contro 0,855 del Qwen3-VL-2B di base, un'accuratezza su dominio held-out di 0,889 contro 0,745, e un errore di calibrazione atteso su dati held-out di 0,054 contro 0,160. Sostiene anche un'inferenza fino a circa 21 volte più veloce quando si pongono molte domande su una sola immagine.
Perché quelli piccoli sono quelli interessanti
L'economia conta più dell'architettura. Evan Schwartz, che gestisce un feed di contenuti personalizzati chiamato Scour, ha scritto il 29 settembre di inviare 54 domande (50 noul, 3 choice, 1 score) su circa 1,1 milioni di documenti al mese. Il suo set di domande è di circa 2.150 token e rappresenta circa l'88% dei token di input per richiesta, perché le domande vengono rinviate identiche ogni volta. La sua bolletta totale è sotto i 150 dollari al mese, cifra che secondo lui un LLM generalista non potrebbe eguagliare su quel volume. Chiede ai laboratori di aggiungere il prompt caching o set di domande riutilizzabili, e segnala una richiesta aperta sul repository del TypeSafe SDK.
Altri stanno già costruendo soluzioni alternative. Un progetto chiamato Jeb, pubblicato su GitHub il 29 settembre, trasforma qualsiasi endpoint compatibile con OpenAI in un servizio decisionale in stile Jev. Legge le probabilità logaritmiche dei token e restituisce JSON strutturato su POST /v1/systemone. Il suo README è schietto sulla dipendenza: un'API può essere compatibile con OpenAI per la chat ordinaria pur mancando dei logprobs di cui Jeb ha bisogno, quindi bisogna verificare quella capacità prima di scegliere un provider. PostHog ha pubblicato lo stesso giorno Jeeves, un modello Qwen3.5-9B da 9B con LoRA e una pointer head che ragiona prima di decidere, più un drafter a diffusione block-4. Riporta 0,889 sul proprio split di test held-out contro 0,857 di Jev e 0,822 di Kev-9B, e 0,935 sui tier pubblici di JevBench contro 0,866 di Jev. Il dato di 0,3 s per richiesta è senza thinking; con il thinking la mediana è 3,3 s su una H100 a fp8.
Un dato che invita alla prudenza è arrivato da Casco il 28 settembre. L'azienda di sicurezza ha fatto passare 2.449 risultati attraverso otto modelli, tra cui Jev, Claude e GPT, chiedendo a ciascuno di scegliere le otto metriche di base CVSS 3.1. Ogni modello ha ottenuto in media un punteggio più alto del riferimento pubblicato da Casco. Jev ha assegnato 550 valutazioni critical a un dataset che contiene 55 risultati critical pubblicati. GPT-6 Astra ha avuto l'errore assoluto medio più basso, 1,92 punti; Jev si è classificato settimo con 3,40. L'output strutturato non si è tradotto in un giudizio migliore sulla gravità.
Altrove, il 29 settembre, Sebastian Raschka ha pubblicato una lunga storia tecnica della classificazione del testo che prova a collocare Jev nel contesto. Osserva che il bag-of-words con naive Bayes risale almeno al 1961 e che persino il filtro antispam originale di Gmail pare lo usasse. Il suo giudizio è misurato: per un problema ristretto e ben definito, un modello in stile Jev probabilmente non batterà un classificatore specializzato, ma è molto più generale. Simple AI ha approfittato della giornata per lanciare Tango, un modello audio-native per il rilevamento di fine turno. Secondo l'azienda arriva a una mediana di 300 ms prima di un rilevatore convenzionale di attività vocale, e scatta da 3,7 a 4,7 volte meno spesso a metà discorso rispetto a Smart Turn a parità di copertura delle fini di turno. Sul benchmark pubblico LiveKit manca 15 fini di turno reali su 400, contro 54 di Soniox e 197 di Deepgram Flux.
Il filo conduttore è che il livello dei modelli piccoli e on-device è dove il deployment sta davvero accadendo, e dove ora si fanno le discussioni sulla misurazione. La card di Qevi-2B è esplicita: i suoi numeri si riproducono solo attraverso la lettura dei logits, non tramite .generate(): "Se chiami .generate() e analizzi il testo, non li riprodurrai, perché quello non è il percorso su cui il modello è stato messo a punto." È un avvertimento utile per chiunque misuri questi sistemi. Un modello può sembrare peggiore di quanto sia solo perché gli si chiede di parlare.
Fonti
12- 01d1: Liquid AI's First Decision ModelEN
- 02Qevi-2B: A Jev-style finetuned model for image classificationEN
- 03Please add prompt caching to Jev-style modelsEN
- 04Jeb: Turn any OpenAI API into a decision modelEN
- 05Jeeves. Reasoning improves Jev-like decision modelsEN
- 06Every model (incl. Jev) we tested inflates security finding severityEN
- 07Language Models for Text Classification: From Bag-of-Words to JevEN
- 08Tango: Simple AI's Conversational Awareness ModelEN
- 09The System One models ecosystemEN
- 10AI models keep posting screenshots showing sensitive data from inside tech companiesEN
- 11OpenAI announces 'dots' agent after scrapping launch of new AI model over safety concernsEN
- 12Language Models Act on Hidden ValenceEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.