Claude Haiku 5.5 taglia i prezzi API del 90% mentre cambiano i costi di inferenza
Anthropic ha rilasciato Claude Haiku 5.5 l'8 ottobre, riducendo i prezzi dei token fino al 90% per i task ad alto volume di inferenza. La mossa evidenzia una crescente divisione nel mercato: mentre i costi dei modelli piccoli crollano, le spese per hardware e memoria continuano a salire, costringendo gli sviluppatori a bilanciare la velocità grezza con la spesa totale di calcolo.

Anthropic ha rilasciato Claude Haiku 5.5 l'8 ottobre. È il modello piccolo più veloce e conveniente dell'azienda. Il rilascio mira a compiti ad alto volume come query sui dati e supporto clienti.
Secondo The Decoder, il modello costa circa il 75% in meno rispetto al suo predecessore, Haiku 4.5. Per le richieste con prompt fino a 100.000 token, che Anthropic afferma rappresentare circa il 90% delle precedenti richieste Haiku, i prezzi scendono fino al 90%. I token in input ora costano $0.10 per milione, in calo da $1.00. I token in output scendono a $0.50 per milione da $5.00.
Il taglio dei prezzi arriva mentre il resto dello stack diventa più costoso. Pavan Davuluri, responsabile di Windows di Microsoft, ha ammesso nel podcast Inside Windows che il crescente costo della memoria sta spingendo l'azienda a far sì che Windows 11 usi meno RAM. Davuluri ha descritto la memoria come "priorità assoluta" per il settore, notando che gli OEM stanno riportando sul mercato laptop da 8GB. Microsoft ha reso l'"ottimizzazione della memoria per 8GB e superiori" una priorità ufficiale per il resto del 2.026, secondo Windows Latest.
I prezzi più bassi per token non significano sempre bollette totali più basse. Artificial Analysis classifica Haiku 5.5 come il modello di fascia piccola leader con un punteggio di 43 sul suo Intelligence Index. Tuttavia, la piattaforma segnala un consumo di token molto più elevato. Al livello di sforzo massimo, Haiku 5.5 usa circa 162.000 token in output per compito, circa tre volte i 50.000 token necessari per GPT-6 Luna di OpenAI.
Il compromesso di efficienza
Anche a livelli di prestazioni paragonabili, il divario persiste. Con la configurazione "alta", Haiku 5.5 ottiene 38 punti con circa 55.000 token per compito, mentre GPT-6 Luna raggiunge lo stesso punteggio con circa 50.000. In termini di efficienza di Pareto, il rapporto tra prestazioni e uso delle risorse, il modello di OpenAI esce avvantaggiato. Passare da "xhigh" a "max" sforzo su GPT-6 Luna aggiunge solo due punti aumentando il consumo di token di 1.8x.
Anthropic sottolinea che Haiku 5.5 usa un tokenizer aggiornato che consuma leggermente più token per compito rispetto al suo predecessore. La stessa cosa è accaduta con i modelli Opus 4.x, dove l'uso dei token è aumentato di circa il 30% solo per il cambio di tokenizer. I risparmi reali sono probabilmente più piccoli di quanto suggeriscano i prezzi per token, una sfumatura che complica la narrativa di una pura guerra dei prezzi.
Pressioni su hardware e infrastrutture
Mentre i fornitori di API competono sul prezzo, le infrastrutture fisiche necessarie per servire questi modelli rimangono un collo di bottiglia. HPCwire osserva che i sistemi di inferenza AI falliscono diversamente dai servizi web tradizionali. La latenza media può sembrare buona mentre gli utenti sono già insoddisfatti perché le richieste restano in coda in attesa che si formino i batch. Il comportamento di avvio a freddo è un altro problema; avviare un worker di inferenza implica scaricare modelli, caricare pesi in memoria e inizializzare lo stato dell'acceleratore. Kubernetes può mostrare un pod come in esecuzione, ma ciò non significa che il sistema abbia già capacità di servizio effettiva.
Questa complessità guida la domanda di ottimizzazioni di hardware e software specializzati. Magnitude, un motore di inferenza open source lanciato a settembre, afferma di ottimizzare i kernel per hardware specifici per eseguire modelli aperti fino a 2x più velocemente di llama.cpp. Lo strumento compila e regola i kernel sul dispositivo dell'utente, mirando ad ambienti Apple Silicon, NVIDIA, AMD o solo CPU. Mira a ridurre l'uso della memoria del 27% per agente, un fattore critico mentre i costi della RAM salgono.
Anche la posizione conta. Data Center Knowledge riporta su un data center di 20 piani proposto nel centro di Kansas City, progettato per sfruttare la connettività densa dei carrier per un'inferenza a bassa latenza. Steve Austin, fondatore di Revitalization Unlimited, sostiene che l'inferenza deve accadere vicino all'utente perché la latenza conta. Il progetto affronta costi di costruzione più elevati, stimati in $183.000.000 o circa $1.300 per piede quadrato, rispetto alle strutture suburbane. Questo premio è giustificato solo per carichi di lavoro specifici come transazioni finanziarie o interazioni AI in tempo reale.
Il contesto di mercato più ampio
La spinta per un'inferenza più economica non si limita ad Anthropic. I ricercatori su arXiv stanno pubblicando paper sulla mitigazione dell'eccessiva dipendenza in tempo di inferenza e sulla valutazione efficiente delle policy. Un paper inviato il 7 ottobre propone un framework solo-campioni per valutare le policy Best-of-N, che aiuta a selezionare i budget di campionamento più efficaci senza bisogno di accesso alla piena likelihood. Questo lavoro accademico sostiene gli sforzi ingegneristici per rendere l'inferenza più economica e affidabile.
I fornitori di cloud stanno anche adeguando le loro strategie. AWS ha presumibilmente alzato i prezzi della capacità GPU del 15% a fine settembre, una mossa che contrasta con i tagli API di Anthropic. Questa divergenza suggerisce che mentre i costi grezzi di calcolo salgono, la concorrenza a livello di applicazione sta costringendo i fornitori a trovare efficienze altrove. Il risultato è un mercato in cui il costo dell'intelligenza si sta scollegando dal costo del silicio che lo alimenta.
Per gli sviluppatori, il messaggio è chiaro: il token più economico non è sempre la soluzione più conveniente. Il costo totale di proprietà ora dipende dall'efficienza dei token, dall'utilizzo dell'hardware e dai requisiti specifici di latenza del carico di lavoro. Mentre l'inferenza diventa il principale campo di battaglia per l'AI, l'attenzione si sta spostando dalla capacità grezza del modello all'economia della consegna.
Fonti
9- 01Claude Haiku 5.5 arrives with massive price cutsEN
- 02Rising cost of memory, Microsoft explains why Windows 11 will use less RAMEN
- 03Why AI Inference Infrastructure Fails Differently From Traditional ServicesEN
- 04Launch HN: Magnitude (YC S25) – Self-optimizing inference engineEN
- 05Vertical Data Centers Face Cost-Proximity Trade-OffsEN
- 06FTC Issues Letters Warning Hospitals Against Deceptive Pricing PracticesEN
- 07McDonald’s sued for allegedly using AI tool to determine pricingEN
- 08Efficient Best-of-N policy evaluation for inference-time alignmentEN
- 09Understanding and Mitigating Inference-Time Overreliance Using Agentic MemoryEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.