Modelli aperti cinesi, il vantaggio sui prezzi è reale ma non basta
I modelli open-weight cinesi stanno riducendo il divario di prestazioni a costi inferiori. Ma il costo reale per compito completato può salire, e l'ecosistema americano resta forte su cloud e dati proprietari.

La diffusione dei modelli cinesi a pesi aperti è uno dei fenomeni che più ha cambiato il mercato dell'intelligenza artificiale negli ultimi due anni. L'analisi di Banque Lombard Odier ripresa da CorCom riconosce che questi modelli hanno ridotto il divario di prestazioni con le alternative occidentali a un costo nettamente inferiore, ma avverte che i loro vantaggi sono in parte sopravvalutati.
Il costo per compito, non per token
Il punto tecnico è che il prezzo per token non misura il costo reale. Pratiche come la distillazione e la selezione del modello più adatto al singolo compito possono far lievitare il costo per attività completata e il tempo necessario a completarla, annullando parte del risparmio iniziale. Nello stesso tempo, la riduzione dei prezzi tende ad allargare l'adozione invece di ridurre la spesa complessiva: è il meccanismo noto come paradosso di Jevons, per cui una risorsa più economica viene consumata in quantità maggiore.
Nell'analisi, gli Stati Uniti mantengono comunque una posizione solida grazie all'infrastruttura cloud e ai dati proprietari, mentre i modelli di frontiera continuano a giustificare un premio di prezzo sui compiti complessi. Sul piano dell'hardware, il dominio americano negli acceleratori avanzati resta il principale fattore di vantaggio: la Cina compensa con l'abbondanza di energia e con la velocità con cui porta in esercizio la potenza di calcolo disponibile.
Un caso concreto
L'esempio più recente arriva da DeepSeek. Il modello V4.1 Flash, salito il 10 settembre 2026 sulla rete nazionale dei supercomputer cinesi e accessibile tramite API dalla pagina di servizio del modello, adotta un'architettura Mixture-of-Experts da 552 miliardi di parametri, con una struttura asimmetrica Causal-Encoder-Decoder e 8 miliardi di parametri attivati in ingresso e 16 miliardi in uscita. La scheda ufficiale dichiara una riduzione della memoria di cache a un quarto del fabbisogno di HBM e a un ottavo di quello su SSD rispetto alla generazione precedente, con una cache da 890 byte per token e un contesto fino a un milione di token, rilasciato con licenza MIT e formati di quantizzazione FP8, BF16, GPTQ, AWG e GGUF.
«Il modello più economico non è quello che costa meno per token, ma quello che risolve il problema al primo tentativo» — è la regola operativa che emerge dall'analisi.
Che cosa resta da fare
Per le imprese la conseguenza è metodologica: conviene misurare i costi per risultato e non per volume, valutare il modello sullo specifico carico di lavoro e non sui benchmark generali, e mantenere la portabilità tra fornitori per non trovarsi vincolati quando i prezzi cambiano. La disponibilità di modelli a pesi aperti è, da questo punto di vista, un'assicurazione contro il rischio di dipendenza.
Fonti
3- 01CorCom — AI, la Cina sfida i big USA sui prezzi ma l'ecosistema americano tieneIT
- 02IT之家 — DeepSeek V4.1 Flash sulla rete nazionale dei supercomputerZH
- 03DeepSeek — V4.1 Flash release notes (architettura, cache, licenza MIT)EN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.