I costi di inferenza calano: Quail e Magnitude spingono il serving a basso costo
Modal e il Full Stack Data Lab della Carnegie Mellon hanno annunciato il 30 settembre che il loro motore Quail ha elaborato oltre un miliardo di token al minuto su una singola GPU H100, più di 10 volte la loro baseline vLLM, con un prezzo sotto i 6 centesimi per miliardo di token su Modal.

La dichiarazione arriva lo stesso giorno in cui un progetto sostenuto da Y Combinator, Magnitude, ha rilasciato un motore di inferenza open source che mette a punto i propri kernel sull'hardware dell'utente. Entrambi portano avanti la stessa idea: il modello non è più la parte costosa. Lo è lo strato di serving.
Quail nasce dal lavoro congiunto dei ricercatori sull'inferenza di Modal e dei ricercatori sui database del Full Stack Data Lab della Carnegie Mellon. Lo descrivono in un post del 30 settembre sul blog di Modal e in un testo di accompagnamento del laboratorio. Il problema che affrontano è l'AI-SQL, dove le query SQL chiamano modelli linguistici riga per riga. Un singolo filtro richiede una chiamata al modello per ogni riga. Un join ingenuo richiede una chiamata per ogni coppia di righe. La query di benchmark del laboratorio, BIO-4, filtra 5.000 referti medici contro 4.144 termini di reazioni avverse e poi li unisce due volte. Nel post stimano un tempo di esecuzione alla velocità della luce di 894,37 secondi, cioè 14,91 minuti, partendo da un modello roofline che assume il massimo throughput della GPU, la piena sovrapposizione tra CPU e GPU e uno spazio KV cache illimitato.
Eseguire vLLM 0.26.0 con Qwen3 4B FP8 su una H100 a fattore di scala 1,0 ha richiesto 6,84 ore, secondo il laboratorio: 27,55 volte la stima ideale.
Le cause sono due. La prima è l'overhead dell'host: la CPU pianifica le richieste mentre la GPU resta inattiva. La seconda è quello che chiamano KV regret: vLLM scarta uno stato chiave-valore di cui avrà di nuovo bisogno. Il laboratorio conta 174.600.000 token sprecati in quella esecuzione.
Su una query con più join, dove la pianificazione è particolarmente importante, Quail supera il miliardo di token elaborati al minuto per GPU H100 (TPM/GPU), oltre 10 volte più veloce della nostra baseline vLLM sullo stesso hardware.
Il post di Modal attribuisce il vantaggio alla conoscenza anticipata della struttura della query. Sapere in anticipo come è fatta permette al motore di ordinare le richieste e di gestire meglio la cache e l'eliminazione dello stato KV. Per arrivarci è servita una revisione dell'attenzione a cascata in stile Hydragen. Sull'intero benchmark Quail è 1,84 volte più veloce di vLLM, in media geometrica. Nel conteggio rientrano anche due query che gli autori hanno progettato per mostrare dove l'inferenza AI-SQL ha ancora bisogno di migliorare.
Magnitude punta sul tuo silicio
Magnitude, indicata come azienda YC S25, ha preso la strada opposta verso lo stesso problema di costo. Il suo README su GitHub, aggiornato il 30 settembre, descrive un motore che compila e ottimizza i kernel sul dispositivo dell'utente prima che un modello venga eseguito, invece di distribuire kernel precompilati per classi di hardware. Il progetto dichiara fino a 2 volte più veloce di llama.cpp, con il 92% in più di velocità di decodifica su Metal e il 19% su CUDA, oltre al 27% in meno di memoria per agente. Funziona su Apple Silicon, NVIDIA, AMD o su una sola CPU, si collega con un clic ad agenti tra cui Pi, OpenCode, Hermes, Codex e Claude Code, ed è distribuito con licenza Apache 2.0. Prompt, file e modelli restano locali, si legge nel README.
Entrambi i progetti inseguono la stessa economia.
Un indice dei prezzi pubblicato il 30 settembre da AICostBudget, che copre 81 record pubblici di 11 fornitori, colloca il prezzo mediano di input a 1,32 dollari per milione di token e il prezzo mediano di output a 6 dollari. Alla mediana l'output costa circa cinque volte l'input. Lo stesso snapshot ha rilevato uno sconto mediano del 90% sull'input in cache su 58 record comparabili e uno sconto mediano del 50% sul batch su 44. È il dettaglio che conta per chi esegue AI-SQL. I carichi di lavoro che si possono raggruppare in batch e mettere in cache pagano una frazione del prezzo di listino. Quelli che non si possono, pagano il prezzo pieno.
Il conto arriva altrove
L'energia è l'altro numero in gioco.
Un articolo presentato a SOSP '26 il 28 settembre, firmato da Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma e Neeraja J. Yadwadkar, sostiene che ottimizzare i cluster GPU puramente per l'utilizzo può aumentare il consumo energetico. Il loro sistema, EnerTune, usa modelli analitici delle prestazioni e della potenza per modello, incluso il consumo dei modelli colocati su una stessa GPU, e un algoritmo di bin-packing attento all'energia. Riportano un consumo energetico da 1,4 a 2,3 volte inferiore e una potenza assorbita da 1,3 a 2,6 volte inferiore rispetto alle baseline allo stato dell'arte, pur rispettando gli obiettivi di prestazioni.
Gli autori di Quail non sostengono che il loro benchmark risolva la questione. Dicono che due delle query sono state progettate per mostrare dove l'inferenza AI-SQL ha bisogno di migliorare, e presentano la media geometrica di 1,84 volte come un punto di partenza, non un tetto. L'ideale di 14,91 minuti del laboratorio resta un ideale: nessuna implementazione può soddisfare tutte le sue assunzioni.
Un altro dato, dall'altro lato del dibattito sui prezzi.
Un post del 30 settembre di Gagan Kogan, che racconta il lavoro svolto in Pinecone, descrive un test A/B. Togliere un calcolatore di prezzi basato sull'utilizzo dalla pagina dei prezzi ha reso i visitatori il 16% più propensi a registrarsi e il 90% più propensi a contattare l'azienda, senza un aumento dei ticket di supporto sui prezzi. Sette dipendenti su dieci avevano previsto che avrebbe vinto il calcolatore. La trasparenza sui costi, a quanto pare, è una complessità a sé.
Per gli acquirenti la lettura pratica è più ristretta dei titoli. Il prezzo per token sta calando per i carichi di lavoro strutturati e memorizzabili in cache, e i fornitori pubblicano i livelli che lo fanno scendere. L'infrastruttura sottostante, GPU, energia e pianificazione tra le due, è dove si combatte ora la battaglia sui costi.
Fonti
6- 01Building an Ultra-High Throughput AI-SQL EngineEN
- 02Quail: Speeding up AI-SQL by jointly optimizing query planner and inference engineEN
- 03magnitudedev/magnitude: Open source inference engine for agentsEN
- 04AI API Pricing Index, September 2026EN
- 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 06The pricing calculator made people more confused about pricingEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.