Prezzi dell'inferenza ai frammenti: i motori open comprimono i token, il conto dell'hardware sale
Il 30 settembre è uscito un motore di inferenza open source che ottimizza i kernel della CPU sulla macchina dell'utente: dichiara decodifiche fino al 92% più rapide di llama.cpp su Metal. Intanto nuove ricerche e nuovi dati sui prezzi mostrano che il costo di far girare l'AI si sta spaccando in due.

Il 30 settembre Magnitude, azienda di Y Combinator S25, ha pubblicato un motore di inferenza open source per agenti che compila e ottimizza i kernel sull'hardware di chi lo usa. Il repository dichiara che i modelli aperti girano "fino a 2 volte più veloci di llama.cpp", con la decodifica più rapida del 92% su Metal e del 19% su CUDA, e il 27% di memoria in meno per agente. Funziona su Apple Silicon, NVIDIA, AMD o su una CPU, e si collega a Pi, OpenCode, Hermes, Codex, Claude Code e Cline, secondo la pagina GitHub del progetto.
È l'ultimo arrivato in una settimana di dichiarazioni in gara su quanto dovrebbe costare l'inferenza. Lo stesso giorno i ricercatori dietro Quail, uno strato di inferenza consapevole della query, hanno riferito di aver eseguito una query AI-SQL con più join a oltre un miliardo di token al minuto su una singola GPU H100. Secondo loro è oltre 10 volte più veloce della loro baseline vLLM sullo stesso hardware.
Il lato token: la pianificazione batte la forza bruta
Il lavoro su Quail, pubblicato sul blog di Full Stack Data Lab e approfondito su quello di Modal, attacca un carico di lavoro preciso: AI-SQL, dove le query SQL chiamano i modelli linguistici riga per riga. Un filtro richiede una chiamata per riga, un join ingenuo una chiamata per ogni coppia di righe. Su una query di benchmark che i ricercatori chiamano BIO-4, gli input contengono 5.000 referti medici lunghi e 4.144 termini di reazione, usati due volte in due join. La loro tesi è che mandare milioni di chiamate correlate a un motore generico come richieste separate spreca lo stato di prefisso condiviso. Ottimizzando insieme il piano di query e il motore di inferenza, quel sovraccarico si riduce. L'articolo di Modal indica un costo inferiore a 6 centesimi per miliardo di token sulla sua piattaforma e riporta Quail 1,84 volte più veloce di vLLM come media geometrica su un nuovo benchmark AI-SQL, incluse due query che il team ha progettato per mettere in luce le debolezze rimaste.
"Applicazioni di inferenza diverse producono carichi di lavoro di inferenza diversi, e AI-SQL non fa eccezione", si legge nel post di Modal, che osserva come una singola query possa produrre milioni di sequenze da migliaia di token.
Entrambi i numeri arrivano dai team che costruiscono i sistemi, e nessuno dei due è stato riprodotto in modo indipendente dal materiale pubblicato. Il caveat conta, perché il quadro generale dei prezzi è più disordinato di quanto suggerisca qualsiasi singolo guadagno di velocità.
L'indice dei prezzi di settembre di AICostBudget, congelato al taglio del 2026-09-30 UTC, tiene traccia di 81 record pubblici su 11 fornitori. Fissa il prezzo mediano di input a 1,32 dollari per milione di token e quello di output a 6 dollari, un rapporto di 5,0 volte sui 69 record che riportano entrambi i valori. Gli intervalli osservati vanno da 0,10 a 30 dollari per l'input e da 0,10 a 180 dollari per l'output. Lo stesso dataset riporta uno sconto mediano del 90% sull'input in cache su 58 record comparabili e uno sconto mediano del 50% su 44 righe che supportano il batch. In altre parole, i listini sono una guida scarsa a quanto paga davvero un carico di lavoro. Le mediane per fornitore nell'indice vanno da Mistral AI a 0,20 dollari di input e 0,60 di output, su tre record, fino ad Anthropic a 5 e 25 dollari su 13. I 18 record di OpenAI stanno a 2 e 11 dollari; i 14 di Google Gemini a 0,75 e 4,125.
Il lato hardware: energia, non solo utilizzo
Se l'economia dei token migliora, quella delle GPU non la segue in modo evidente. Un paper presentato a SOSP '26 il 28 settembre sostiene che ottimizzare i cluster GPU solo per l'utilizzo può far salire il consumo energetico. Gli autori, Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma e Neeraja J. Yadwadkar, descrivono EnerTune, un sistema di serving che modella prestazioni e assorbimento di potenza per modello, compresi i modelli colocati su GPU condivise, e usa un algoritmo di bin-packing consapevole dell'energia per collocare e configurare i modelli. Il paper dichiara riduzioni di energia da 1,4 a 2,3 volte e di potenza da 1,3 a 2,6 volte rispetto alle baseline allo stato dell'arte, rispettando gli SLO di prestazioni. Fa anche un'osservazione pratica sulla scala: profilare ogni modello su centinaia di configurazioni costa troppo, e la profilazione stessa consuma energia.
È un risultato accademico, non un benchmark di un fornitore, e arriva mentre gli operatori dell'Asia-Pacifico scelgono una strada diversa per tagliare i costi. Light Reading ha riferito il 30 settembre che StarHub e M1 sono in trattative di fusione a Singapore, dove già condividono lo spettro 5G e la rete di accesso radio attraverso una società di proprietà congiunta chiamata Antina. Secondo le informazioni, Singtel deteneva a giugno una quota del 43% del mercato mobile, con M1 al 22%, StarHub al 21% e Simba al 14%.
In Nuova Zelanda, 2degrees e OneNZ hanno proposto di unire le loro reti radio in un'entità di proprietà congiunta, un accordo che dovrebbe arrivare alla Commerce Commission il prossimo anno. Light Reading cita il precedente: l'infrastruttura 5G condivisa di China Telecom e China Unicom arriva ora a 1,5 milioni di stazioni base e a risparmi dichiarati di 56 miliardi di dollari di capex. Sono accordi sulla connettività, non sul calcolo AI, ma mostrano lo stesso istinto: condividere asset fissi costosi batte duplicarli.
Cosa vedono gli acquirenti
Per chi paga davvero l'inferenza, il dato più utile della settimana è forse un monito. Gaurav Kogan, scrivendo il 30 settembre, ha raccontato di aver rimosso un calcolatore di prezzi basato sull'uso in Pinecone dopo un test A/B. I visitatori che non vedevano il calcolatore avevano il 16% di probabilità in più di registrarsi e il 90% in più di contattare l'azienda, scrive, senza un aumento dei ticket di supporto sui prezzi. La sua spiegazione del perché il calcolatore è stato rimosso è precisa: una leggera interpretazione errata poteva produrre una stima gonfiata fino a 1.000 volte, e il calcolatore dava agli utenti una falsa sicurezza. Un sondaggio interno ha rilevato che 7 dipendenti su 10 si aspettavano prestazioni migliori dalla versione con il calcolatore. La lezione vale anche per i prezzi dell'inferenza, dove le tariffe in cache e in batch possono spostare una bolletta di un ordine di grandezza e il numero in evidenza raramente riflette il carico di lavoro.
Altri due elementi del 30 settembre stanno ai margini di questa storia. MindOn ha presentato Mind-1, un modello di AI fisica che secondo l'azienda riduce la latenza di inferenza dei robot da 82ms a 32ms, e osserva che a una velocità dell'end-effector di 3 m/s, 10ms di latenza equivalgono a circa 3cm di movimento. E Transport & Environment ha pubblicato un'analisi, ripresa da CleanTechnica il 29 settembre, secondo cui i guidatori di auto elettriche pagano meno della metà di quanto pagano i guidatori diesel per chilometro, con i diesel che pagano 32 euro in più per pieno rispetto all'inizio dell'anno.
Nessuno dei due è un caso da data center. Entrambi ricordano che il costo dell'inferenza è ormai un vincolo fisico misurato in millisecondi, joule ed euro, non solo in dollari per milione di token.
Il filo conduttore della settimana è che nessun numero da solo chiude la questione. Il 92% di decodifica in più dichiarato da Magnitude è specifico per Metal e auto-riferito. Il miliardo di token al minuto di Quail viene da una query con più join su una H100, con il team stesso che segnala due query di benchmark come aree da migliorare. I risparmi di EnerTune sono modellati contro baseline in un paper. L'indice dei prezzi è un'istantanea congelata di listini che la maggior parte degli acquirenti non paga.
Ciò che resta coerente è la direzione dell'ingegneria: ottimizzare i kernel per il chip esatto, pianificare le query attorno al modello e trattare la potenza come metrica di prima classe. Che poi tutto questo si traduca in inferenza più economica dipende meno da un singolo benchmark che da quanto arriva in produzione.
Fonti
9- 01Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 04AI API pricing index - September 2026EN
- 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 06Singapore, New Zealand operators seek partnerships to cut costsEN
- 07The pricing calculator made people more confused about pricingEN
- 08Mind-1: Cutting robot inference latency from 82ms to 32msEN
- 09Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.