Stessi punteggi, conti diversi: come leggere le valutazioni dei modelli open source
Nell'Artificial Analysis Intelligence Index Xiaomi MiMo-V2.6-Pro e il modello closed source Grok 4.7 hanno entrambi 46 punti, ma il costo medio per completare un'attività differisce di circa 29 volte. Il costo oltre il punteggio sta diventando una nuova dimensione di valutazione.

Nei comunicati di lancio dei modelli open source la cosa che sfugge più facilmente sono le condizioni dietro i punteggi. Prendiamo Xiaomi MiMo-V2.6-Pro: nell'Artificial Analysis Intelligence Index ha ottenuto 46 punti, primo tra gli open source. Per coincidenza, il modello closed source Grok 4.7, presentato lo stesso giorno, nello stesso indice ha totalizzato anch'esso 46 punti. Guardando solo questa riga, i due modelli sembrano alla pari.
Cambiando dimensione, però, la conclusione cambia. Secondo le misurazioni di Artificial Analysis, la versione high-end di Grok 4.7 costa in media 3,74 dollari per completare un'attività. MiMo-V2.6-Pro ne costa 0,13, circa 29 volte in meno. Lo stesso punteggio può quindi corrispondere a costi d'uso completamente diversi.
La seconda cosa che sfugge è la configurazione specifica del test. Il risultato di MiMo-V2.6 viene da un addestramento con reinforcement learning di soli 30 Step. Ogni Step comprende 1.568 Prompt e ogni domanda fa provare al modello 16 percorsi diversi. Su DeepSWE v1.1, che valuta i Coding Agent, Pro è passato da 58,4 a 72,57 punti, Flash da 48,7 a 65,68 punti. Questi numeri contano se la generalizzazione fuori campione regge, non se il modello ha accumulato punti sul set di addestramento.
La terza variabile è la scelta della valutazione stessa. Nelle note ufficiali su V4.1 Flash si sottolinea che, dopo test interni ed esterni, il modello supera V4 Pro su prestazioni, costi, velocità e tempo totale. Ma "supera" è la formulazione ufficiale. Sono i metodi di test, il numero di campioni e gli strumenti di valutazione a determinare quanto ampiamente queste conclusioni si possano estendere.
Il modo giusto di leggere una valutazione è quindi tenere insieme tre cose: in quali condizioni il modello ha girato, quanto costa completare un'attività e come si comporta fuori campione. Citare solo il punteggio più alto equivale a usare un punto al posto di una superficie.
Per chi sceglie un modello in azienda, la pratica più utile è un confronto su piccola scala con i propri compiti: fissare il quadro di valutazione, confrontare costo per attività e tasso di successo, poi decidere quale modello mettere in produzione. Il punteggio è l'ingresso, il conto è la conclusione.
Fonti
3Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.