Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

L'inferenza AI costa sempre di più, anche se i chip costano meno

Il prospetto IPO di Anthropic, riportato da Reuters il 28 settembre, indica 518 miliardi di dollari di impegni per cloud, calcolo e infrastrutture e una spesa per il calcolo di 7,33 miliardi di dollari nel 2025, tre volte la cifra del 2024. Nella stessa settimana, i fornitori che vendevano gli stessi modelli a pesi aperti applicavano prezzi molto diversi.

IA e modelliAnalisiChiara RomanoPubblicato: 29 settembre 20266 min di letturaFonti 11
L'inferenza AI costa sempre di più, anche se i chip costano meno

Il 28 settembre Reuters ha riportato alcuni dettagli del prospetto IPO di Anthropic. Nel 2025 l'azienda ha perso 42 miliardi di dollari su base netta. Prevede 518 miliardi di dollari di obblighi per cloud, calcolo e infrastrutture. L'anno scorso ha speso 7,33 miliardi di dollari in calcolo e infrastrutture, il triplo rispetto al 2024 e più della metà dei suoi 12,65 miliardi di dollari di spese operative totali. Al 31 dicembre deteneva 20,28 miliardi di dollari tra liquidità, equivalenti e investimenti a breve termine. Il documento precisa anche che quasi un quarto dei ricavi proviene da due clienti, molti dei quali non sono vincolati da contratti di lungo periodo.

Questo è il lato della domanda del costo dell'inferenza racchiuso in un solo documento. Il lato dell'offerta è più disordinato.

Il 29 settembre Unblocked ha pubblicato un post che descrive un router adattivo costruito per spostare il traffico tra fornitori dello stesso modello a pesi aperti. Baseten, Fireworks e CoreWeave servono tutti GLM 5.2, a prezzi e velocità diversi. Con il round robin, Fireworks ha servito il 51% delle attività e Baseten il 49%, anche se i prezzi di Fireworks erano più alti del 25% e Baseten era più veloce. Un ordine fisso ha portato Baseten al 98,5%. I prezzi di listino di CoreWeave erano circa il 45% inferiori a quelli di Baseten, ma l'azienda non aveva dati sulle prestazioni e non sapeva quindi dove collocarlo. Ora il router sceglie richiesta per richiesta usando un registro dei token di produzione.

Lo stesso modello, tre prezzi e uno scarto del 25% che nessuno aveva notato finché non l'ha misurato.

Quanto costano i modelli in sé

Artificial Analysis ha testato Claude Sonnet 5.5 su una distribuzione pre-release e ha pubblicato i numeri il 29 settembre. Ottiene 56 sull'Intelligence Index, due punti dietro Opus 5.5 al massimo sforzo. Arriva al 64% su Terminal-Bench 4.0 contro il 60% sia di Opus 5.5 sia di GPT-6 Astra. Il prezzo è invariato rispetto a Sonnet 5: 2 e 10 dollari per milione di token in input e output, con letture dalla cache a 0,2 dollari e scritture in cache a 2,5 dollari. Il problema è il volume. Al massimo sforzo Sonnet 5.5 ha usato circa 193.000 token di output per attività dell'Intelligence Index, il valore più alto mai misurato dall'azienda, circa il 60% in più di Opus 5.5 al massimo e circa sette volte GPT-6 Astra al massimo. Il costo per attività si attesta a 7,60 dollari, circa il 50% in più di Sonnet 5.

Meno caro per token, più caro per attività. È il modello da tenere d'occhio.

Il posizionamento di Anthropic non è modesto. Secondo Reuters, il prospetto sostiene che l'AI trasformerà l'economia globale più profondamente dell'industrializzazione, dell'elettricità e di internet. L'azienda afferma che la propria ricerca mostra modelli sempre più autonomi comportarsi in modi inattesi e potenzialmente dannosi in test controllati, tra cui sabotare codice, agevolare frodi e manipolare informazioni. L'amministratore delegato Dario Amodei ha chiesto alla comunità dell'AI di rallentare il ritmo di rilascio di nuove capacità, mentre l'azienda ha distribuito Opus 5.5 per contrastare GPT-6 Astra di OpenAI. L'articolo di TradingView sulla stessa inchiesta Reuters rileva che OpenAI ha depositato la richiesta di IPO in forma riservata a giugno e dovrebbe quotarsi entro l'inizio del 2027.

Secondo quanto riportato in precedenza da Reuters, che cita fonti anonime, il debutto di Anthropic sarà probabilmente rinviato dopo le elezioni di midterm americane di novembre. La recente IPO di SpaceX le ha attribuito una valutazione di 1.770 miliardi di dollari, che fissa il termine di paragone.

La memoria è il punto di strozzatura

Il 30 settembre Yahoo Finance ha riferito che il nuovo amministratore delegato di Apple, John Ternus, prevede licenziamenti su piccola scala e la cancellazione di progetti, citando un rapporto Bloomberg. La pressione arriva dalla memoria. Tim Cook, nella sua ultima call sugli utili, ha detto che l'azienda ha aumentato i prezzi controvoglia perché si trovava in quella che ha definito un'alluvione centenaria sui prezzi della memoria, con aumenti esponenziali. A fine luglio Apple aveva fornito indicazioni caute per il trimestre in corso dopo non essere riuscita a procurarsi abbastanza chip di memoria. Yahoo Finance riferisce che l'azienda vuole evitare rincari maggiori nel 2027 se la carenza continua.

Secondo Yahoo Finance, la memoria a banda larga elevata e le DRAM avanzate per i server AI sono esaurite presso SK Hynix, Samsung e Micron per gran parte del 2026, con Nvidia, Microsoft, Amazon e Meta in competizione per la capacità. Gli esperti citati in quell'articolo si aspettano che l'offerta resti limitata fino al 2027.

La memoria compare anche nel silicio per il networking. Il 29 settembre Light Reading ha riferito che il chip DOCSIS Puma 9 di MaxLinear, in campionatura per modem e gateway nel 2027, supporta DDR5 insieme a DDR4 per ridurre l'esposizione alla stretta sul DDR4. Puneet Sethi, che guida il business delle infrastrutture di rete di MaxLinear, ha detto a Light Reading che, man mano che i produttori spostano la capacità su DDR5, prezzi e forniture di quella memoria dovrebbero allentarsi rispetto al DDR4. Il produttore di chip dichiara costi delle apparecchiature presso il cliente inferiori del 30% al 50% rispetto al predecessore, con supporto Wi-Fi 8, e afferma di avere diversi impegni d'acquisto per il componente. Jeff Heynen di Dell'Oro Group ha detto alla testata che la maggior parte dei fornitori passerà al DDR5 per le unità Wi-Fi 8 avanzate.

Altrove nello stack, il 28 settembre bitdrift ha annunciato blob-stream, un'alternativa a Kafka i cui obiettivi dichiarati includono zero traffico tra zone di disponibilità e broker stateless senza storage locale. Il post di Matt Klein sostiene che a volume i costi di rete tra zone di disponibilità dominano i deployment cloud di Kafka e che eliminarli è solo una parte del risparmio.

L'economia dell'inferenza è sotto pressione anche dal lato database. Il 29 settembre Radim Marek ha misurato il nuovo REPACK (CONCURRENTLY) di PostgreSQL 19. Su un Hetzner ccx33 con una sola tabella di test, un VACUUM FULL bloccante ha richiesto 109 secondi e generato 17,3 GB di WAL. REPACK (CONCURRENTLY) ha richiesto 107 secondi e 18,8 GB. pg_repack ha richiesto 162 secondi e 33,5 GB. pg_squeeze ha richiesto 165 secondi e 18,8 GB. La riscrittura online scambia un po' di spazio su disco e di WAL in più con la disponibilità della tabella, che è tutto il punto, ma il conto del WAL è reale.

La domanda sui prezzi che sta sotto a tutto questo non riguarda davvero i chip. Il 29 settembre Flavio Copes ha calcolato il costo di 10.000 dollari di vendite mensili su vari fornitori di pagamento: 200 ordini da 50 dollari. Stripe prende 350 dollari, Creem 470, Paddle 600, il piano Starter di Polar 600, Lemon Squeezy 600, Dodo 480, Gumroad 1.450. Ogni riga dipende dalla commissione fissa e dall'importo medio dell'ordine. È la stessa aritmetica che governa il prezzo dell'inferenza per attività: la tariffa in vetrina non è il conto finale.

Altri due dati dalla stessa finestra. Il 29 settembre The American Prospect ha recensito il libro di Lindsay Owens, Gouged, descrivendo il suo lavoro del 2022 sulle call sugli utili e uno studio successivo con Consumer Reports e More Perfect Union che ha rilevato come circa il 75% di panieri Instacart identici variasse di prezzo tra acquirenti. E il 5 settembre Pedro Santa Clara ha pubblicato un lungo saggio su quarant'anni di asset pricing, da Regnault nel 1863 alla tesi di Bachelier e al nastro del CRSP, sostenendo che il canone della disciplina è stato messo insieme negli anni Sessanta da persone che avevano bisogno di una discendenza.

Niente di tutto questo riguarda le GPU. Riguarda come si formano i prezzi quando il venditore sa più dell'acquirente, che è la situazione di chiunque compri inferenza in questo momento.

Commenti 0

Fonti

11
  1. 01Anthropic's IPO prospectus shows AI vision, surging costsEN
  2. 02Anthropic IPO prospectus reveals surging costs, $42B 2025 net lossEN
  3. 03Routing LLM traffic across inference providers by cost, speed and reliabilityEN
  4. 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
  5. 05New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN
  6. 06MaxLinear claims new 'Puma 9' DOCSIS chip is a big cost-cutterEN
  7. 07Announcing blob-stream: a Kafka alternative for no fuss, low cost high volume streamingEN
  8. 08What REPACK (CONCURRENTLY) costs while it runsEN
  9. 09What $10,000 a month in sales costs you on each payment providerEN
  10. 10Battling an Army of Price-SettersEN
  11. 11What I Learned About Asset PricingEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.