Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Nella domanda di IPO di Anthropic c'è un numero da 518 miliardi di dollari per i costi di inferenza

Il prospetto per l'IPO di Anthropic, riportato da Reuters il 29 settembre, rivela obblighi verso cloud e infrastrutture per 518 miliardi di dollari e una perdita netta di 42 miliardi per il 2025: il segno più chiaro che i costi di inferenza e di calcolo sono il modello di business, non una voce di bilancio.

IA e modelliAnalisiChiara RomanoPubblicato: 29 settembre 20263 min di letturaFonti 5
Nella domanda di IPO di Anthropic c'è un numero da 518 miliardi di dollari per i costi di inferenza

Il numero che conta nel documento di Anthropic non è la valutazione, che secondo Reuters potrebbe superare i 2.000 miliardi di dollari. È la cifra di 518 miliardi che l'azienda prevede di spendere per obblighi verso cloud, calcolo e infrastrutture nei prossimi anni. Reuters ha riportato il dato il 29 settembre, citando il prospetto che dice di aver visto. Il pezzo di CNBC su quella notizia lo riassume.

Lo stesso documento registra una perdita netta di 42 miliardi per il 2025. I ricavi sono cresciuti di 12 volte fino a quasi 4,6 miliardi, mentre la perdita operativa, escludendo le svalutazioni legate a raccolte di capitali precedenti, ha superato gli 8 miliardi. L'anno scorso Anthropic ha speso 7,33 miliardi in calcolo e infrastrutture, il triplo rispetto al 2024 e più della metà dei suoi 12,65 miliardi di spese operative totali.

Il prezzo di un token non è il prezzo della GPU

Chi legge questi numeri come una semplice bolletta per le GPU dovrebbe guardare cosa hanno misurato nello stesso periodo i tracker dei prezzi. Il 28 settembre Meetrix.io ha controllato i listini on-demand e ha trovato una H100 a 6,88 dollari l'ora su AWS contro 10,98 su GCP, circa il 37% in meno. Il dato AWS arriva dal tracker EC2 di Vantage. La stessa analisi stima però il costo per milione di token a 0,76 dollari su una H100 completamente occupata e a 3,06 con un utilizzo al 25%, usando un valore di throughput dichiarato come segnaposto, 2.500 token al secondo. Il rapporto, un divario di quattro volte, non dipende da quell'ipotesi. Nessun cambio di cloud produce un effetto del genere.

GPUAdvisor, che dice di monitorare 14 fornitori e ha aggiornato la sua tabella il 1 ottobre, elenca le tariffe per GPU su AWS, GCP, Azure, Lambda, CoreWeave, RunPod, Nebius e altri. Osserva che i cloud specializzati in GPU offrono prezzi per GPU da due a quattro volte inferiori rispetto agli hyperscaler. La sua conclusione principale è più limitata di quanto sembri: i prezzi hanno smesso di comportarsi come una tabella da consultare, quindi il confronto regge solo se controlli la pagina del fornitore prima di impegnare budget.

Anthropic non compra guardando solo il prezzo. Il prospetto dice che quasi un quarto dei ricavi è arrivato da due clienti l'anno scorso, e avverte che molti dei suoi clienti più grandi non sono vincolati da contratti di lungo periodo.

Il risparmio sta nel routing, non negli acquisti

Il 29 settembre Unblocked ha pubblicato i propri numeri. Descrive un router che sposta il traffico tra Baseten, Fireworks e CoreWeave, tutti con lo stesso modello a pesi aperti. Con il round-robin, Fireworks serviva il 51% delle attività a prezzi più alti del 25% rispetto a Baseten e con prestazioni più lente. Un ordine fisso portava Baseten al 98,5% delle attività, ma ogni modifica richiedeva un deploy. La versione adattiva assegna ai fornitori un punteggio di 0,7 sul costo e 0,3 sulla velocità, pubblicando un riepilogo su Redis ogni cinque minuti, così da non fare chiamate di rete a ogni richiesta. I listini di CoreWeave erano circa il 45% sotto quelli di Baseten, e il router poteva campionarlo senza intervento umano.

Artificial Analysis, in una nota del 29 settembre, aggiunge una variabile legata al modello. Claude Sonnet 5.5, a 2 dollari per milione di token in input e 10 per milione in output, arriva a 56 sul suo Intelligence Index ma consuma circa 193.000 token di output per attività al massimo sforzo. È il valore più alto che abbia misurato, circa sette volte GPT-6 Astra (max). Il costo per attività si attesta a 7,60 dollari, circa il 50% sopra Sonnet 5.

Le due cifre non si contraddicono, misurano cose diverse: il prezzo di listino per GPU-ora e il costo per attività completata. Meetrix.io dice chiaramente di non aver fatto benchmark sul throughput e che il suo dato di token al secondo è un segnaposto. L'impegno da 518 miliardi di Anthropic è un contratto, non un benchmark.

Commenti 0

Fonti

5
  1. 01Anthropic's IPO prospectus shows AI vision, surging costs | ReutersEN
  2. 02GPU Costs for LLM Inference: AWS vs GCP (2026)EN
  3. 03Cloud GPU Pricing - Cost Intelligence for H100, A100 & B200EN
  4. 04Routing LLM traffic across inference providers with TCP-style congestion controlEN
  5. 05Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.