I prezzi delle GPU salgono, le tariffe cloud di listino scendono: quanto costa davvero l'inferenza
Il prospetto per l'IPO di Anthropic, riportato da Reuters il 28 settembre, mette a bilancio 518 miliardi di dollari di obblighi futuri verso cloud e capacità di calcolo contro una perdita netta di 42 miliardi per il 2025. I dati sui prezzi arrivati questa settimana suggeriscono che è il secondo numero a contare davvero.

Le tariffe di listino non dicono dove finiscono i soldi. Meetrix ha confrontato AWS e GCP con i prezzi verificati il 28 settembre: una H100 on-demand costa 6,88 dollari l'ora su AWS e 10,98 su GCP. Quel divario del 37% esiste. Ma è più piccolo della differenza che si crea facendo girare la stessa scheda a un quarto del carico. Con la GPU satura il costo è di 0,76 dollari per milione di token, al 25% di utilizzo sale a 3,06. Meetrix calcola su un throughput indicativo di 2.500 token al secondo.
Il silicio inattivo costa più di qualsiasi scelta di fornitore.
GPUAdvisor monitora 14 fornitori e dichiara di aver aggiornato i dati il 1 ottobre. Sulle schede più vecchie i cloud specializzati battono gli hyperscaler con margini ampi: una A4000 a 0,15 dollari per GPU-ora su Hyperstack, una L40S a 0,38 su Lium, una RTX 4090 a 0,40. Il sito le presenta come stime rilevate e invita a confermare le tariffe sulla pagina del fornitore. È giusto, perché quella stessa pagina elenca una RTX 4090 a 0,74 su RunPod. Due prezzi, stesso modello, quasi il doppio.
Il conto dei token è un altro numero ancora
Il 29 settembre Artificial Analysis ha pubblicato la sua valutazione di Claude Sonnet 5.5 di Anthropic. Il modello arriva a 56 sull'Intelligence Index, due punti dietro Opus 5.5 al massimo sforzo, e consuma circa 193.000 token di output per attività. Secondo il laboratorio è il 60% in più di Opus 5.5 e circa sette volte GPT-6 Astra al massimo sforzo. Anthropic ha lasciato i prezzi invariati, 2 dollari per milione di token in input e 10 per milione in output, ma il costo per attività arriva a 7,60 dollari, circa il 50% sopra Sonnet 5.
Stesso listino, conto diverso. Il danno lo fanno i token.
AI Pricing Guru aggiorna le tariffe ogni giorno e ha fatto l'ultimo aggiornamento il 1 ottobre. Per le API generiche indica una forbice utilizzabile tra 0,50 e 15 dollari per milione di token in output. L'input costa in genere da due a otto volte meno, e l'input in cache taglia un altro 75% o 90% dove il fornitore lo supporta. Il suo calcolatore segue 154 modelli attivi su più di 10 fornitori.
Il retrieval cambia l'aritmetica prima ancora che la generazione cominci. Spheron ha pubblicato il 29 settembre la sua ripartizione dei costi: una configurazione RAG standard che pesca cinque blocchi da 500 token aggiunge 2.500 token di contesto per query. Una domanda che come chat semplice costerebbe da 100 a 200 token in input può arrivare a costare da 15 a 20 volte tanto sul lato input.
Il 29 settembre Unblocked ha descritto il proprio lavoro di routing. Sposta il traffico di GLM 5.2 tra Baseten, Fireworks e CoreWeave in base a un punteggio ponderato per il 70% sul costo e per il 30% sulla latenza. Con un ordine fisso che privilegia Baseten, quel fornitore ha servito il 98,5% delle attività nella prima settimana piena. L'azienda dice che i prezzi di listino di CoreWeave erano circa il 45% sotto quelli di Baseten e che non aveva dati sulle prestazioni per collocarlo. Questa è la situazione degli acquisti: l'opzione più economica è spesso quella che nessuno ha misurato.
Fonti
7- 01Anthropic's IPO prospectus shows sweeping AI vision, surging costs: ReutersEN
- 02GPU Costs for LLM Inference: AWS vs GCP (2026)EN
- 03Cloud GPU Pricing - Cost Intelligence for H100, A100 & B200EN
- 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
- 05AI Token Cost Calculator 2026: 154 Models by TierEN
- 06RAG Inference Cost Calculator: Cost Per Token, Broken Down (2026)EN
- 07Routing LLM traffic across inference providers with TCP-style congestion controlEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.