Il calcolo del costo di inferenza: cosa nascondono i prezzi orari delle GPU
Il tracker di GPUAdvisor, aggiornato al 1° ottobre, copre ora 14 provider cloud che vendono capacità H100, H200, A100 e B200. La forbice tra le offerte più economiche e quelle più care sullo stesso silicio è così ampia che la tariffa oraria in vetrina dice molto poco.

I siti di confronto si sono moltiplicati più in fretta degli sconti. Il 1° ottobre GPUAdvisor ha dichiarato che il suo tracker dei prezzi delle GPU nel cloud copre 14 provider e tutti i principali acceleratori. Sopra la tabella stampa un avviso: i prezzi sono approssimativi, variano per regione e disponibilità e riflettono stime di settembre 2026. Questo è lo stato del mercato. Il prezzo di listino è un punto di partenza, non una fattura.
Meetrix ha pubblicato il proprio confronto il 29 settembre, con prezzi verificati il 28 settembre per istanze on-demand in US East e us-central1. La conclusione è netta: AWS costa meno a listino per una H100 o una A100, GCP un po' meno se basta una singola L4. Una H100 costa 6,88 dollari l'ora su AWS contro 10,98 su GCP.
L'utilizzo batte la scelta del cloud
Lo stesso articolo però ridimensiona il proprio titolo. Meetrix ha fatto i conti su un throughput ipotetico di 2.500 token di output al secondo. Il costo per milione di token passa da 0,76 a 3,06 dollari sulla H100 di AWS quando l'utilizzo scende dal 100% al 25%. Sulla H100 di GCP la stessa oscillazione va da 1,22 a 4,88 dollari. L'articolo precisa che il dato di throughput è un'ipotesi, non una misurazione, e che i rapporti tra le righe non dipendono da esso.
Quindi un risparmio del 37% cambiando cloud vale la pena. È più piccolo della penalità per un pomeriggio di inattività. Meetrix segnala anche un problema di dati: la pagina dei prezzi GPU di Google rende la tabella lato client, quindi l'autore non ha potuto leggerla in modo programmatico. Tre tracker concordavano su 87,83 dollari per la a3-highgpu-8g, mentre un quarto indicava 88,49. È una discrepanza da segnalare, non da mediare.
C'è un ostacolo strutturale sul versante economico. AWS vende la A100 solo in configurazioni da 8 GPU, p4d.24xlarge con schede da 40 GB e p4de.24xlarge con 80 GB. Una singola A100 significa quindi la a2-highgpu-1g di GCP, anche se lì ogni GPU costa di più. Meetrix stima la A100 da 8 GPU di AWS a 21,96 dollari l'ora, 2,75 per GPU, contro 3,67 sulla configurazione a GPU singola di GCP.
I prezzi reserved e spot complicano ancora il quadro. Meetrix riporta che una prenotazione di 3 anni fa risparmiare dal 54% al 57% su AWS, che gli sconti spot su H100 o A10G vanno dal 53% al 62% e che lo spot su L40S è dell'1%. Nota anche che AWS ha tagliato i prezzi on-demand del 33% per P4d e P4de e del 44% per P5, misurati rispetto ai prezzi del 31 maggio 2025.
Una cosa che invece è salita: gli EC2 Capacity Blocks for ML, dove si prenotano GPU per una finestra fissa. The Register ha riportato un aumento di circa il 15% a gennaio 2026, con la p5e passata da 34,61 a 39,80 dollari l'ora.
Comprare lo stesso modello da tre venditori
L'altra metà del costo di inferenza non è affatto la GPU. Unblocked ha pubblicato il 29 settembre un resoconto sull'instradamento del traffico open-weight tra Baseten, Fireworks e CoreWeave, tutti con GLM 5.2 a prezzi e velocità diversi. Il primo schema, round-robin, ha mandato il 51% dei task a Fireworks e il 49% a Baseten nell'ultima settimana piena, anche se Fireworks costava il 25% in più ed era più lento.
Un ordine fisso ha risolto: 98,5% dei task a Baseten e 1,5% a Fireworks. Poi sono arrivati i problemi operativi. Cambiare l'ordine richiedeva una modifica al codice e un deploy. Il circuit breaker trattava cinque 429 in un minuto come un'interruzione totale. I prezzi di listino di CoreWeave, circa il 45% sotto quelli di Baseten, restavano inutilizzati perché nessuno aveva dati sulle prestazioni. Il sistema sostitutivo assegna a ogni provider un punteggio su costo e velocità, pesati 0,7 e 0,3, e sposta il traffico senza un ingegnere. Il post dice che i numeri vengono dal suo ledger di token di produzione e dai log.
Il comportamento dei token a livello di modello entra direttamente in quella fattura. Artificial Analysis ha riportato il 29 settembre che Claude Sonnet 5.5 segna 56 sul suo Intelligence Index, due punti dietro Opus 5.5 al massimo sforzo, ma usa circa 193.000 token di output per task dell'indice. L'azienda lo definisce il consumo di token più pesante che abbia misurato, circa il 60% sopra Opus 5.5 e circa 7 volte GPT-6 Astra al massimo sforzo. Sonnet 5.5 costa 2 dollari per milione di token di input e 10 per milione di output, invariato rispetto a Sonnet 5, eppure Artificial Analysis lo colloca a 7,60 dollari per task, circa il 50% in più di Sonnet 5. L'azienda precisa che le valutazioni sono state eseguite su un deployment pre-release con un bug che influiva sugli output strutturati, corretto per la versione pubblica.
Dove vanno invece i soldi
Il prospetto IPO di Anthropic, visto da Reuters e riportato da CNBC il 29 settembre, dà il lato della domanda di questo mercato in una riga: 7.330.000.000 di dollari spesi in calcolo e infrastruttura nel 2025, il triplo rispetto al 2024, più della metà dei 12.650.000.000 di dollari di spese operative totali. Lo stesso documento descrive 518.000.000.000 di dollari di obblighi per cloud, calcolo e infrastruttura negli anni a venire e una perdita netta di 42.000.000.000 di dollari per il 2025.
La memoria è il vincolo che emerge altrove. Yahoo Finance ha riportato il 30 settembre che il nuovo amministratore delegato di Apple, John Ternus, prevede licenziamenti su piccola scala e cancellazioni di progetti, secondo un report di Bloomberg, mentre i costi della memoria salgono. L'articolo cita l'ex CEO Tim Cook nella sua ultima call sugli utili, che ha descritto un'alluvione centenaria sui prezzi della memoria. Nomina anche SK Hynix, Samsung e Micron come aziende che hanno venduto gran parte della loro capacità premium di memoria per l'IA fino al 2026.
Niente di tutto questo rende sbagliata la tabella dei prezzi orari delle GPU. La rende incompleta. La stessa impostazione di Meetrix è quella onesta: sistema l'utilizzo prima di impegnarti, e leggi lungo una colonna invece che attraverso le righe, perché nessun cambio di cloud ti fa risparmiare quanto ti costa un pomeriggio di inattività.
Fonti
6- 01Cloud GPU Pricing — Cost Intelligence for H100, A100 & B200EN
- 02GPU Costs for LLM Inference: AWS vs GCP (2026)EN
- 03Routing LLM traffic across inference providers with TCP-style congestion controlEN
- 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
- 05Anthropic's IPO prospectus shows AI vision, surging costsEN
- 06New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.