AWS ha l'H100 a meno, ma è l'utilizzo a decidere la bolletta dell'inferenza
AWS mette a listino un H100 a 6,88 dollari l'ora, Google Cloud a 10,98. Il divario è del 37%, ma pesa molto meno del fattore quattro che separa una GPU sotto carico da una ferma. Prezzi verificati il 28 settembre.

AWS mette a listino un H100 a 6,88 dollari l'ora, Google Cloud a 10,98. Il divario è del 37%, ma pesa molto meno del fattore quattro che separa una GPU sotto carico da una ferma. I prezzi sono stati verificati il 28 settembre.
Il confronto viene da meetrix.io. Il sito dichiara di aver controllato quel giorno i prezzi di listino on demand per la regione US East di AWS e per us-central1 di Google Cloud. La stessa pagina dice che un H100 costa quattro volte tanto per token al 25% di utilizzo rispetto al carico pieno, su entrambi i cloud. L'autore avverte anche che il dato di token al secondo usato nell'esempio è un segnaposto, non un benchmark.
La tabella, e chi costa meno
Secondo Meetrix, AWS costa circa il 37% in meno di Google Cloud per H100 e il 25% in meno per A100, sempre on demand. L'unico punto in cui Google vince è la scheda piccola L4: g2-standard-4 viene circa 0,70 dollari l'ora contro gli 0,805 di g6.xlarge su AWS. L'articolo stesso quantifica la differenza in circa 75 dollari al mese.
La riga dell'A100 nasconde una trappola. AWS vende l'A100 solo in configurazioni da otto GPU, p4d.24xlarge con schede da 40GB e p4de.24xlarge con quelle da 80GB, a 2,75 dollari per GPU-ora e 21,96 per il nodo. Se serve una sola A100, la a2-highgpu-1g di Google a 3,67 dollari l'ora resta l'opzione pratica, anche se ogni GPU costa di più.
Sulle fonti, meetrix è insolitamente trasparente. Dice che i dati AWS vengono dal tracker EC2 di Vantage, aggiornato al 28 settembre 2026, e che la pagina prezzi GPU di Google renderizza la tabella lato client, quindi non è leggibile in modo automatico. I numeri GCP sono perciò quelli pubblicati dai tracker di prezzo. Tre di loro concordano su 87,83 dollari per la a3-highgpu-8g, mentre un quarto indica 88,49. È un disaccordo piccolo, ma resta un disaccordo, e vale la pena sapere da che parte cade il proprio budget.
L'utilizzo batte la caccia al prezzo
L'aritmetica nel post di meetrix usa 2.500 token di output al secondo su una sola H100. L'autore lo etichetta come ipotesi, non come misura. Al 100% di carico, AWS arriva a 0,76 dollari per milione di token e GCP a 1,22. Al 50% di carico diventano 1,53 e 2,44. Al 25% di carico, 3,06 e 4,88.
Leggi la colonna dall'alto verso il basso, non la riga da sinistra a destra, consiglia il post.
È l'istruzione giusta. Cambiare cloud fa risparmiare il 37% sullo stesso H100. Lasciare la scheda ferma tre quarti del tempo costa quattro volte tanto. La prima è una decisione di acquisto, la seconda una decisione di pianificazione, e solo la seconda si accumula ogni giorno.
GPUAdvisor, che dichiara di monitorare 14 fornitori e di aver eseguito l'ultimo controllo giornaliero il 1 ottobre 2026, mostra dove porta quella logica di caccia al prezzo. Nelle sue liste la L40S di Lium sta a 0,38 dollari per GPU-ora, segnalata come 89% sotto AWS, la RTX A6000 di Thunder Compute a 0,35 e la A4000 di Hyperstack a 0,15. La stessa pagina osserva che i cloud specializzati in GPU offrono prezzi per GPU da due a quattro volte inferiori a quelli degli hyperscaler, e che i prezzi sono approssimativi e variano per regione. Gli specialisti non sono lo stesso prodotto di un hyperscaler, ma il divario non è rumore.
Anche gli sconti legati agli impegni spostano il numero, e tagliano in entrambe le direzioni. Meetrix riporta che una prenotazione AWS triennale fa risparmiare dal 54% al 57%, con l'avvertenza che le GPU invecchiano in fretta. GPUAdvisor stima gli impegni annuali al 35-40% per endpoint di inferenza sempre attivi e lo Spot di GCP fino al 70% di sconto sulle istanze A100 e H100. Meetrix aggiunge che lo Spot su AWS oggi offre dal 53% al 62% di sconto per H100 e A10G, ma solo l'1% per L40S.
Il prodotto di capacità che è andato nella direzione opposta
Non tutti i prezzi sono scesi. Meetrix cita il report di The Register su un aumento di circa il 15% a gennaio 2026 per i Capacity Blocks di EC2 per il machine learning, con il p5e passato da 34,61 a 39,80 dollari l'ora. Osserva che si tratta di un prodotto separato dalle tariffe on demand della tabella di confronto. È esattamente il tipo di distinzione che si perde quando un team cita un unico numero di GPU in riunione di pianificazione.
Il contesto di tutto questo è una stretta sull'offerta che va ben oltre le GPU. Yahoo Finance ha riportato il 30 settembre che il nuovo CEO di Apple, John Ternus, sta pianificando licenziamenti su piccola scala e cancellazioni di progetti, citando un report di Bloomberg, mentre i costi della memoria salgono. L'articolo cita l'ex CEO Tim Cook che, nella sua ultima call sugli utili, parla di un'alluvione centenaria nei prezzi della memoria, e nota che SK Hynix, Samsung e Micron hanno in gran parte esaurito la capacità premium per l'AI per buona parte del 2026. Compute e memoria se le contendono gli stessi acquirenti.
Il prospetto di IPO di Anthropic, visto da Reuters e riportato il 29 settembre, dà un numero a quell'appetito: 7,33 miliardi di dollari spesi in compute e infrastruttura nel 2025, un balzo di tre volte rispetto al 2024, più della metà dei 12,65 miliardi di dollari di spese operative totali, contro 518 miliardi di dollari di obblighi su cloud, computing e infrastruttura previsti per gli anni a venire. È l'impegno futuro di un solo acquirente, ed è più grande del fatturato annuo in GPU della maggior parte dei cloud.
Intanto il lato software continua a gonfiare la bolletta. Artificial Analysis ha riportato il 29 settembre che Claude Sonnet 5.5 usa circa 193.000 token di output per attività dell'Intelligence Index al massimo sforzo, il consumo di token più alto che dichiara di aver misurato, circa 7 volte GPT-6 Astra al massimo. Anthropic lo ha prezzato identico a Sonnet 5, a 2/10 dollari per milione di token in input e output, quindi il costo sta nel numero di token, non nel listino, e Artificial Analysis lo stima in 7,60 dollari per attività, circa il 50% in più di Sonnet 5.
Il routing è l'altra leva, e si sta automatizzando. Unblocked ha descritto il 29 settembre un router adattivo che assegna punteggi ai fornitori su costo e velocità, con pesi 0,7 e 0,3, e sposta il traffico quando uno peggiora. Prima, il round-robin mandava il 51% delle attività di GLM 5.2 a Fireworks, a prezzi superiori del 25% a quelli di Baseten. Dopo un ordine fisso, Baseten serviva il 98,5%. L'azienda dice che un terzo fornitore, CoreWeave, aveva prezzi circa il 45% sotto quelli di Baseten, e che non aveva dati sulle prestazioni per collocarlo.
Niente di tutto questo rende sbagliata la domanda AWS contro GCP. La rende la seconda domanda. Misura prima l'utilizzo, poi discuti della tariffa oraria.
Fonti
6- 01GPU Costs for LLM Inference: AWS vs GCP (2026)EN
- 02Cloud GPU Pricing — Cost Intelligence for H100, A100 & B200EN
- 03New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN
- 04Anthropic's IPO prospectus shows sweeping AI vision, surging costs: ReutersEN
- 05Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
- 06Routing LLM traffic across inference providers with TCP-style congestion controlEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.