Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

I modelli decisionali rinunciano a generare testo: la piccola AI on-device punta sui logit

Due modelli usciti il 29 settembre spingono la stessa idea: invece di generare token, i piccoli modelli dovrebbero restituire probabilità calibrate. Il d1 di Liquid AI e un fine-tune di Qwen3-VL-2B chiamato Qevi-2B seguono entrambi questa strada.

IA e modelliAnalisiGiulia FerrariPubblicato: 29 settembre 20264 min di letturaFonti 6
I modelli decisionali rinunciano a generare testo: la piccola AI on-device punta sui logit

Sono usciti a sei minuti di distanza l'uno dall'altro, martedì. Liquid AI ha pubblicato alle 20:09 UTC la documentazione di d1, che definisce il suo primo modello decisionale. MeerDevelopment ha caricato Qevi-2B su Hugging Face alle 20:16 UTC. Nessuno dei due genera testo.

La documentazione di Liquid AI è esplicita sul meccanismo. Un modello decisionale "valuta una situazione e restituisce probabilità calibrate su un insieme fisso di esiti in una sola chiamata, con zero token generati". L'API espone tre forme di domanda: noul (sì/no, restituisce un float), choice (scegliere tra opzioni denominate) e score (una posizione ponderata per probabilità su una scala ordinata). Nei documenti c'è un esempio: la stringa "I have been waiting over three weeks for my order and nobody has responded to my emails" restituisce un noul di 0.999 per la domanda "Is this message a complaint from the customer?". La risposta riporta anche usage.output_tokens pari a 0.

Leggere i logit, saltare la frase

Qevi-2B arriva allo stesso risultato per un'altra via. È un fine-tune completo di Qwen3-VL-2B-Instruct che risponde a domande chiuse sulle immagini. Legge i logit dell'LM-head nella posizione in cui il modello inizierebbe a rispondere, limitandosi ai token di risposta consentiti. Chiedetegli se in una foto c'è una scala e restituisce P(Yes) = 0.97. La model card avverte che chiamare .generate() e analizzare il testo non riprodurrà i numeri pubblicati, "perché non è il percorso su cui il modello è stato messo a punto".

I guadagni dichiarati sono grandi e specifici. Rispetto al Qwen3-VL-2B di base fatto passare attraverso lo stesso identico percorso di lettura, Qevi-2B segna un'accuratezza in-domain di 0.977 contro 0.855, e 0.889 su domini tenuti fuori contro 0.745. L'errore di calibrazione atteso sui dati tenuti fuori scende da 0.160 a 0.054. La card riporta anche un'inferenza circa 21 volte più veloce quando si pongono molte domande su una sola immagine: il raggruppamento delle domande condivide un'unica codifica dell'immagine.

C'è un'avvertenza da leggere con attenzione. Il corpus di addestramento copre solo domande di tipo noul e choice, quindi il tipo score non è testato. E la card ritira esplicitamente le raccomandazioni precedenti sulla temperatura: a T = 2.45 l'ECE sui dati tenuti fuori torna a 0.160, cancellando l'intero guadagno di calibrazione.

Piccoli, veloci e puntati sulla classificazione

È l'argomento on-device nella sua forma attuale. La guida di Ailoitte allo sviluppo di piccoli modelli, pubblicata nelle ultime 12 ore, lo inquadra in termini di costi: servire un modello da 7B può essere "da 10 a 30 volte più economico in latenza, energia e calcolo" rispetto a un modello da 70B a 175B, citando un position paper NVIDIA del 2025. Osserva anche che i piccoli modelli girano on-premises, cosa che conta per i dati sanitari e finanziari.

Il saggio di Sebastian Raschka del 29 settembre sulla classificazione del testo fa lo stesso punto dalla parte opposta. Descrive Jev, un modello che ha causato "un vero fenomeno culturale nelle comunità tecniche nelle ultime 2 settimane", come essenzialmente un classificatore di testo più veloce ed economico dei LLM generali sulla classificazione, ma più generale dei modelli specifici per compito. Precisa di non avere alcun legame con Jev e nessun accesso gratuito.

Il repository jeeves di PostHog, aggiornato il 29 settembre, aggiunge il ragionamento a quello schema. Jeeves è un modello da 9B simile a Jev, costruito su Qwen3.5-9B con LoRA e una pointer head, addestrato con SFT e CISPO. Riporta 0.889 complessivo su uno split di test tenuto fuori, contro 0.857 di Jev e 0.822 di Kev-9B, e 0.935 sui tier pubblici di JevBench contro 0.866 di Jev. Il pensiero costa tempo: circa 3.3 secondi di mediana per richiesta su una H100 in fp8, contro 0.3 secondi senza.

I numeri non puntano tutti nella stessa direzione. Jeeves batte Jev nel complessivo ma perde su Transfer (0.746 contro 0.800) e su MMLU-Pro 10-way (0.739 contro 0.840). Risponde anche al 5.5% delle domande non conoscibili con p ≥ 0.9, meglio del 9.0% di Jev ma peggio dello 0.0% di Kev-9B.

Le previsioni di mercato per la categoria variano molto, ed è il caso di segnalarlo invece di farne una media. MarketsandMarkets stima il mercato degli SLM a 930.000.000 di dollari nel 2025, in salita a 5.450.000.000 di dollari entro il 2032 con un CAGR del 28,7%, mentre wizr.ai cita una cifra di 7.760.000.000 di dollari nel 2023, in crescita del 15,6% dal 2024 al 2030. Le due stime descrivono mercati di dimensioni diverse.

Quello che suggerisce la coppia di rilasci del 29 settembre è più stretto e più concreto: per il lavoro di tipo classificatorio, il formato stesso dell'output viene ridisegnato intorno alle probabilità, non alla prosa.

Commenti 0

Fonti

6
  1. 01d1: Liquid AI's First Decision ModelEN
  2. 02Qevi-2B: A Jev-style finetuned model for image classificationEN
  3. 03Jeeves. Reasoning improves Jev-like decision modelsEN
  4. 04Language Models for Text Classification: From Bag-of-Words to JevEN
  5. 05Small Language Model Development: Lower Cost, More PrivacyEN
  6. 06The Rise of Small Language Models in Enterprise AI Adoption [2026]EN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.