L'economia dell'inferenza cambia: Anthropic spende 7,33 miliardi in calcolo, Sonnet 5.5 consuma più token di chiunque altro
Il prospetto IPO di Anthropic, visto da Reuters, mostra che nel 2025 l'azienda ha speso 7,33 miliardi di dollari in calcolo e infrastrutture, il triplo del 2024. Intanto uno dei suoi modelli più recenti consuma più token di output per attività di qualunque modello misurato da Artificial Analysis.

Il 29 settembre Artificial Analysis ha pubblicato una valutazione di Claude Sonnet 5.5 di Anthropic. Al massimo sforzo il modello usa circa 193.000 token di output per attività dell'Intelligence Index. È il consumo più alto mai registrato dalla società di test, circa sette volte quello di GPT-6 Astra, sempre al massimo sforzo. Non è un round di finanziamento né il lancio di un chip: è una misurazione, e arriva nello stesso momento della più grande comunicazione sui costi dell'anno nel settore.
Il prospetto IPO di Anthropic, riportato per primo da Reuters e ripreso da CNBC e TradingView il 28 e 29 settembre, mostra che l'anno scorso l'azienda ha speso 7,33 miliardi di dollari in calcolo e infrastrutture, più della metà dei 12,65 miliardi di spese operative totali. L'azienda prevede inoltre 518 miliardi di dollari di obblighi futuri verso cloud, calcolo e infrastrutture. Il prezzo per token è ormai il modo standard per confrontare i modelli. Artificial Analysis osserva che Anthropic ha applicato a Sonnet 5.5 lo stesso prezzo di Sonnet 5, 2 dollari per milione di token in input e 10 dollari per milione di token in output, come GPT-6 Sol. Secondo la stessa valutazione il modello costa circa 7,60 dollari per attività, all'incirca il 50% in più del costo per attività di Sonnet 5, semplicemente perché emette più token per raggiungere punteggi comparabili.
Il consumo di token è la variabile di costo che nessuno prezza al banco
Al massimo sforzo, dove raggiunge prestazioni vicine a quelle di Opus 5.5, Claude Sonnet 5.5 ha usato circa 193.000 token di output per attività dell'Intelligence Index. È il consumo di token più alto che abbiamo misurato.
Artificial Analysis segnala anche una riserva: le valutazioni sono state eseguite su una distribuzione pre-release con un bug che incideva sugli output strutturati, corretto per la versione pubblica, e la società prevede di ripetere i test rilevanti. Sonnet 5.5 arriva a 56 sull'Intelligence Index, due punti dietro Opus 5.5 al massimo sforzo, e totalizza il 64% su Terminal-Bench 4.0 contro il 60% di Opus 5.5 e GPT-6 Astra.
Intanto il conto per servire quel traffico continua a muoversi in una sola direzione. Secondo un post su getunblocked.com datato 29 settembre, l'azienda instrada il traffico del modello open-weight GLM 5.2 tra Baseten, Fireworks e CoreWeave, e ha scoperto che i prezzi di listino di CoreWeave sono circa il 45% sotto quelli di Baseten. Il suo router adattivo pesa il costo a 0,7 e la velocità a 0,3, sulla logica che il modello è identico qualunque provider lo serva. Il post è schietto sulla configurazione precedente: una distribuzione round-robin mandava il 51% delle attività a Fireworks, a prezzi più alti del 25% rispetto a Baseten, senza alcun vantaggio.
La memoria è dove vanno i soldi
Sul fronte hardware la pressione non si è allentata. Yahoo Finance ha riferito il 30 settembre che il nuovo CEO di Apple John Ternus pianifica licenziamenti su piccola scala dentro team numerosi e la cancellazione di progetti, citando un report di Bloomberg, mentre i costi della memoria si fanno sentire. L'articolo cita l'amministratore delegato uscente di Apple Tim Cook che nella sua ultima call sugli utili ha parlato di quella che ha definito un'alluvione centenaria sui prezzi della memoria, con aumenti esponenziali. Apple aveva già diffuso a fine luglio previsioni di ricavi caute perché non riusciva a procurarsi abbastanza chip di memoria.
Lo stesso pezzo rileva che SK Hynix, Samsung Electronics e Micron hanno in gran parte esaurito la capacità premium di memoria per l'AI per buona parte del 2026, mentre Nvidia, Microsoft, Amazon e Meta costruiscono infrastrutture per l'AI. Si prevede che l'offerta resti limitata fino al 2027. È lo sfondo su cui va letta ormai ogni proiezione sui costi di inferenza: non conta solo quanti token emette un modello, ma quanto costa la memoria dentro il cluster che lo serve.
Il documento depositato da Anthropic, come riportato da Reuters, mette la domanda in termini brutali. I ricavi sono cresciuti di dodici volte nel 2025 fino a quasi 4,6 miliardi di dollari, ma l'azienda ha registrato una perdita netta di 42 miliardi di dollari, inclusi circa 34 miliardi di oneri contabili legati all'aumento del valore stimato di finanziamenti convertibili in azioni. Ha anche avvertito che quasi un quarto dei ricavi proviene da due clienti e che molti dei suoi maggiori clienti non sono vincolati da contratti di lungo periodo.
Una questione di prezzo senza risposta netta
Il divario tra i prezzi di listino per token e il costo reale per attività non è un dettaglio contabile da poco. Artificial Analysis colloca Sonnet 5.5 fuori dalla frontiera di Pareto tra Intelligenza e Costo per attività, con le impostazioni di sforzo più basse dietro configurazioni di GPT-6 Sol che offrono prestazioni equivalenti con meno token di output. L'impostazione ad alto sforzo viene descritta come molto vicina a GPT-6 Sol per intelligenza, a un costo per attività praticamente identico.
Altre fonti del dossier puntano nella stessa direzione, anche se non riguardano direttamente l'inferenza. Un post del 29 settembre su flaviocopes.com confronta le commissioni dei fornitori di pagamento su un mese da 10.000 dollari e trova aliquote effettive tra il 3,5% e il 6% per tutti tranne Gumroad al 14,5%. È un promemoria di quanto il confronto apparente tra prezzi dipenda dall'unità scelta: una commissione fissa di 0,40 dollari è lo 0,8% di un ordine da 50 dollari e il 4% di un ordine da 10 dollari.
Resta aperta la domanda se il prezzo dell'inferenza seguirà lo stesso schema. Il prospetto di Anthropic delinea un'azienda che scommette sul fatto che la scala prima o poi piegherà la curva dei costi, mentre i suoi stessi modelli rendono più caro servire le attività. Secondo quanto riportato in precedenza da Reuters, che cita fonti, l'IPO sarà probabilmente rinviata a dopo le elezioni di midterm statunitensi di novembre, con una valutazione attesa oltre i 2.000 miliardi di dollari, più del doppio della stima di 965 miliardi di dollari fatta dall'azienda stessa a maggio.
Gli investitori che valuteranno quel numero dovranno soppesare due documenti pubblicati a un giorno di distanza: un prospetto che mostra 518 miliardi di dollari di impegni infrastrutturali futuri e un benchmark che mostra come il più recente modello di fascia media dell'azienda usi più token di output di qualunque altro misurato prima. Nessuno dei due è fatale da solo. Insieme inquadrano la domanda che il settore dell'AI ha evitato per due anni: quanto costa davvero completare un'attività.
Fonti
6- 01Anthropic's IPO prospectus shows AI vision, surging costs | ReutersEN
- 02Anthropic IPO prospectus reveals surging costs, $42B 2025 net lossEN
- 03Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
- 04Routing LLM traffic across inference providers with TCP-style congestion controlEN
- 05Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN
- 06What $10k a month in sales costs you on each payment providerEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.