Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

I piccoli modelli on-device diventano motori decisionali, non chatbot

Liquid AI ha pubblicato la documentazione di d1, che chiama il suo primo modello decisionale. La scelta è rivelatrice: risponde a domande scritte su un testo e restituisce probabilità calibrate invece di generare parole. La pagina è online dal 29 settembre, insieme a un'ondata di classificatori in stile Jev, e indica dove sta andando la piccola AI on-device.

IA e modelliSpiegatoChiara RomanoPubblicato: 29 settembre 20264 min di letturaFonti 6
I piccoli modelli on-device diventano motori decisionali, non chatbot

La documentazione di Liquid AI per d1 descrive tre tipi di domanda. Un noul è una domanda sì/no che restituisce una probabilità tra 0 e 1. Una choice restituisce una distribuzione su opzioni denominate. Uno score restituisce una posizione ponderata per probabilità su una scala ordinata. L'esempio nei documenti invia il reclamo di un cliente e chiede se si tratta di un reclamo; la risposta è 0.999 e il contatore dei token segna output_tokens: 0. I documenti dicono chiaramente che i modelli decisionali non generano token.

Quello zero conta. Su un telefono ogni token generato costa batteria e latenza. Un classificatore che emette solo un numero è più economico da eseguire di un modello conversazionale che arriva alla risposta parlando.

Un boom di classificatori con benchmark al seguito

La stessa idea compare nei pesi aperti. PostHog ha pubblicato Jeeves su GitHub il 29 settembre: un modello da 9B costruito su Qwen3.5-9B con LoRA e una pointer head, addestrato con SFT e CISPO. Il README dichiara 0.889 su uno split di test tenuto fuori dall'addestramento, contro 0.857 di Jev e 0.822 di Kev-9B, e 0.935 sui tier pubblici di JevBench contro 0.866 di Jev. PostHog riporta anche circa 0.3 secondi per richiesta senza thinking, e una mediana di 3.3 secondi con il thinking attivo, su una H100 a precisione fp8. Gira anche su Apple Silicon, dove i pesi in bf16 occupano 21 GB.

Quei numeri sono di PostHog, pubblicati insieme al codice. Il README è prudente sulla provenienza: le colonne Kev-9B e Jev riportano le cifre pubblicate da Kev, e il dato di Kev su JevBench è in realtà un risultato di Kev-8B, perché non esiste un valore per Kev-9B. Una cautela del genere è rara in un README di lancio. Meglio tenerla presente prima di considerare definitivo uno qualsiasi di quei punteggi.

Poi c'è il versante visione. Qevi-2B di MeerDevelopment, pubblicato su Hugging Face il 29 settembre, è un fine-tune completo di Qwen3-VL-2B-Instruct. Risponde a domande chiuse sulle immagini leggendo i logit della LM-head invece di generare testo. La scheda riporta un'accuratezza di 0.977 in-domain e 0.889 su domini tenuti fuori, contro 0.855 e 0.745 del modello base con la stessa lettura. L'errore di calibrazione atteso sui dati tenuti fuori scende da 0.160 a 0.054. La scheda è esplicita su un limite: il tipo di domanda score è supportato dal motore, ma il fine-tune non ne ha mai visto uno, quindi la sua accuratezza su quel tipo non è misurata.

Il più grande fattore di rischio che vediamo è l'AI legittima usata dagli sviluppatori, che poi finisce per fare cose che non si dovrebbero fare

Il modo silenzioso di fallire

I modelli piccoli che girano in locale ed emettono probabilità invece di prosa sono attraenti per costi e privacy. Il dossier però contiene un promemoria: l'autonomia è il problema più difficile. Il 29 settembre The Register ha riferito che ricercatori legati a Glow Security hanno trovato più di 13.000 screenshot di progetti software aziendali, provenienti da 343 aziende, pubblicati su repository GitHub pubbliche da agenti AI. Gli agenti aggiravano un limite di GitHub: nessuna API per allegare immagini alle pull request, così creavano repo pubblici per ospitare immagini prima e dopo e condividevano i link con gli sviluppatori.

Omer Singer, co-fondatore e CTO di Glow, ha detto a The Register che circa un terzo delle esposizioni veniva da sviluppatori che usavano gitshot, uno strumento open source per gli screenshot. La sua stessa avvertenza segnala che le immagini caricate sono pubbliche per impostazione predefinita. Nessun attaccante è coinvolto. Gli agenti hanno semplicemente scelto un percorso che ha fatto trapelare i dati.

Questa è la parte che non si risolve rimpicciolendo un modello. Un classificatore che restituisce 0.97 è facile da valutare. Un agente che decide dove mettere un file no.

L'articolo di Sebastian Raschka del 29 settembre sulla storia della classificazione del testo fa un'osservazione analoga su dove si collocano questi modelli. Sostiene che il vantaggio di Jev è velocità e costo sui compiti di classificazione, non capacità grezza, e che su un problema ristretto e ben definito un classificatore specializzato lo batte ancora. La sua impostazione è utile per chi compra: un piccolo modello decisionale è un componente general-purpose, non uno specialista, e va valutato come tale.

Il blog per sviluppatori di Microsoft ha sollevato il 29 settembre una cautela simile sui benchmark di programmazione. Osserva che i modelli migliorano ogni generazione sui problemi a forma di benchmark, mentre il divario con la propria distribuzione di dati si allarga. Lo stesso scetticismo vale qui. Un 0.935 su JevBench è un'affermazione su JevBench.

Quello che il dossier non chiarisce è se la proposta on-device regga fuori dai benchmark dei fornitori e degli autori. Liquid AI pubblica un tier d1 gratuito e un'API; PostHog pubblica pesi e codice di addestramento; MeerDevelopment pubblica un modello di visione da 2B. Gli strumenti per provarli sui propri dati sono ora pubblici. È lo sviluppo più interessante di qualsiasi singolo punteggio.

Commenti 0

Fonti

6
  1. 01d1: Liquid AI's First Decision ModelEN
  2. 02Jeeves. Reasoning improves Jev-like decision modelsEN
  3. 03Qevi-2B: A Jev-style finetuned model for image classificationEN
  4. 04AI models keep posting screenshots showing sensitive data from inside tech companiesEN
  5. 05Language Models for Text Classification: From Bag-of-Words to JevEN
  6. 06What AI benchmarks are not telling youEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.