Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Stessi punteggi, conti diversi: come leggere le valutazioni dei modelli open source

Nell'Artificial Analysis Intelligence Index Xiaomi MiMo-V2.6-Pro e il modello closed source Grok 4.7 hanno entrambi 46 punti, ma il costo medio per completare un'attività differisce di circa 29 volte. Il costo oltre il punteggio sta diventando una nuova dimensione di valutazione.

IA e modelliOpinioneChiara RomanoPubblicato: 18 settembre 20265 min di letturaFonti 3
Stessi punteggi, conti diversi: come leggere le valutazioni dei modelli open source

Nei comunicati di lancio dei modelli open source la cosa che sfugge più facilmente sono le condizioni dietro i punteggi. Prendiamo Xiaomi MiMo-V2.6-Pro: nell'Artificial Analysis Intelligence Index ha ottenuto 46 punti, primo tra gli open source. Per coincidenza, il modello closed source Grok 4.7, presentato lo stesso giorno, nello stesso indice ha totalizzato anch'esso 46 punti. Guardando solo questa riga, i due modelli sembrano alla pari.

Cambiando dimensione, però, la conclusione cambia. Secondo le misurazioni di Artificial Analysis, la versione high-end di Grok 4.7 costa in media 3,74 dollari per completare un'attività. MiMo-V2.6-Pro ne costa 0,13, circa 29 volte in meno. Lo stesso punteggio può quindi corrispondere a costi d'uso completamente diversi.

La seconda cosa che sfugge è la configurazione specifica del test. Il risultato di MiMo-V2.6 viene da un addestramento con reinforcement learning di soli 30 Step. Ogni Step comprende 1.568 Prompt e ogni domanda fa provare al modello 16 percorsi diversi. Su DeepSWE v1.1, che valuta i Coding Agent, Pro è passato da 58,4 a 72,57 punti, Flash da 48,7 a 65,68 punti. Questi numeri contano se la generalizzazione fuori campione regge, non se il modello ha accumulato punti sul set di addestramento.

La terza variabile è la scelta della valutazione stessa. Nelle note ufficiali su V4.1 Flash si sottolinea che, dopo test interni ed esterni, il modello supera V4 Pro su prestazioni, costi, velocità e tempo totale. Ma "supera" è la formulazione ufficiale. Sono i metodi di test, il numero di campioni e gli strumenti di valutazione a determinare quanto ampiamente queste conclusioni si possano estendere.

Il modo giusto di leggere una valutazione è quindi tenere insieme tre cose: in quali condizioni il modello ha girato, quanto costa completare un'attività e come si comporta fuori campione. Citare solo il punteggio più alto equivale a usare un punto al posto di una superficie.

Per chi sceglie un modello in azienda, la pratica più utile è un confronto su piccola scala con i propri compiti: fissare il quadro di valutazione, confrontare costo per attività e tasso di successo, poi decidere quale modello mettere in produzione. Il punteggio è l'ingresso, il conto è la conclusione.

Commenti 0

Fonti

3
  1. 01DeepSeek V4.1 Flash – Artificial AnalysisEN
  2. 026 天烧光 2000 多万,拿下开源第一ZH
  3. 03DeepSeek-V4.1-Flash 模型卡EN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.