Quail supera il miliardo di token al minuto su una sola H100, mentre il monitoraggio dei prezzi delle GPU si affolla
Modal e il Full Stack Data Lab della Carnegie Mellon sostengono che il loro motore Quail ha spinto una query AI-SQL con più join oltre il miliardo di token al minuto su una singola H100, più di 10 volte la loro baseline vLLM. Lo scrivono in un post del 30 settembre.

Alla rivendicazione è attaccato un prezzo: meno di 6 centesimi per miliardo di token su Modal, secondo il blog dell'azienda. È il tipo di numero che decide se AI-SQL finisce in produzione o viene archiviato in silenzio, perché un filtro su un milione di righe equivale a un milione di chiamate al modello.
Due colli di bottiglia, due correzioni
Il testo del Full Stack Data Lab, pubblicato il 24 settembre, inquadra il problema in termini di database. Una query che incrocia 5.000 referti medici con 4.144 termini di reazione si espande in milioni di richieste di inferenza separate. Gli autori le hanno eseguite una alla volta con vLLM 0.26.0, Qwen3 4B FP8 su una H100: ci sono volute 6,84 ore. Secondo i loro calcoli è 27,55 volte la stima roofline di 894,37 secondi, cioè 14,91 minuti. Indicano due cause. La prima è l'overhead dell'host: la CPU pianifica le richieste mentre la H100 resta inattiva. La seconda è il KV regret: il motore scarta uno stato chiave-valore di cui avrà di nuovo bisogno. Su quel benchmark con fattore di scala 1.0, vLLM ha elaborato 174,6 milioni di token che non erano necessari.
La risposta di Quail è guardare il piano della query prima di eseguirla. Se si conosce la forma dei join, si possono ordinare le richieste in modo che i prefissi condivisi restino in cache. Si può anche raggruppare il lavoro che un motore generalista tratta come non correlato. Il post di Modal lo descrive come una revisione della cascade attention in stile Hydragen. Entrambi i team parlano di una collaborazione tra i ricercatori di inferenza di Modal e il gruppo di database della CMU.
Sull'intero benchmark il numero è più piccolo: 1,84 volte più veloce di vLLM, con media geometrica. Nel conteggio rientrano due query che gli autori hanno costruito apposta per mostrare dove l'inferenza AI-SQL fallisce ancora.
I dati sui prezzi che stanno sotto
Le affermazioni sui costi suonano diverse a seconda di quanto costa prima un'ora di GPU, e quel numero ora si muove di settimana in settimana. GPUAdvisor segue 14 provider. Elenca Hyperstack a 0,15 dollari l'ora per una A4000 16GB, Lium a 0,22 per una RTX 3090 e 0,38 per una L40S, e la RTX A5000 di RunPod a 0,27 on-demand contro 0,16 nel suo livello condiviso Community Cloud. La sua pagina, aggiornata l'ultima volta il 1 ottobre, dice chiaramente che i prezzi delle GPU hanno smesso di essere una tabella di consultazione stabile.
FitMyLLM affronta la stessa domanda dal lato dei token. Sostiene che una tariffa oraria non dice nulla senza un dato di throughput. La sua tabella live legge le tariffe dalle API dei provider ogni tre minuti e ordina per costo per milione di token in output con un solo stream. La scheda RTX 3060 di Vast.ai risulta la più economica a 0,261 dollari per milione di token. Una RTX 5090 su Vast.ai viaggia a 227 token al secondo e costa 0,576 per milione. Il sito ammette apertamente che le schede da datacenter si posizionano male su questa metrica per come è costruita, dato che una H100 o una H200 giustificano il prezzo servendo molte richieste in parallelo. Aggiunge che quelle righe sono stime, non misure.
"Il prezzo di un marketplace è l'annuncio di un singolo host, non una tariffa pubblicata: può sparire, e gli host possono far girare una scheda sotto il suo limite di potenza di fabbrica, il che costa velocità che il prezzo non mostra."
Per chi compra API invece di affittare GPU, l'indice di settembre di AICostBudget congela 81 record pubblici di 11 provider con data di taglio 2026-09-30. Il prezzo mediano di input è 1,32 dollari per milione di token, quello di output 6, e il rapporto mediano output-input è 5,0 volte. I record con input in cache mostrano uno sconto mediano del 90%, quelli con prezzo Batch un 50%, su 58 e 44 righe comparabili rispettivamente. L'indice avverte esplicitamente che le sue mediane per provider non sono prezzi di mercato ponderati per l'uso, e che non rivendica un calo annuo a livello di settore.
L'efficienza sale di livello
L'energia è la prossima voce. Un paper presentato a SOSP '26 il 28 settembre da Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma e Neeraja J. Yadwadkar sostiene che ottimizzare solo l'utilizzo della GPU può far salire i consumi. Il loro sistema, EnerTune, usa modelli analitici delle prestazioni e della potenza per modello, incluso il consumo dei modelli colocati su una GPU condivisa, dentro un algoritmo di bin-packing attento all'energia. Gli autori riferiscono di aver rispettato gli SLO di prestazioni riducendo l'energia da 1,4 a 2,3 volte e la potenza assorbita da 1,3 a 2,6 volte rispetto alle baseline allo stato dell'arte. Profilare ogni configurazione è di per sé troppo costoso su larga scala, ed è per questo che i modelli sono analitici e non misurati.
L'inferenza su dispositivo porta lo stesso argomento dal lato opposto. Magnitude, azienda di YC S25 che ha pubblicato su Hacker News il 30 settembre, distribuisce un motore open source con licenza Apache 2.0. Il motore compila e ottimizza i kernel sull'hardware dell'utente prima che il modello giri. Il suo README dichiara fino a 2 volte più veloce di llama.cpp, con il 92% in più nella decodifica su Metal e il 19% su CUDA, e il 27% in meno di memoria per agente. Nessun costo per token, nulla esce dalla macchina. Il compromesso è che fa girare modelli aperti sulla tua GPU, non un modello di frontiera su quella di qualcun altro.
Cosa devono guardare gli acquirenti
Tre numeri nel dossier puntano in direzioni diverse. L'1,84 volte di velocità media di Quail è reale ma modesto accanto al titolo del miliardo di token al minuto, e gli autori stessi lo dicono. La tariffa misurata più economica di FitMyLLM, 0,261 dollari per milione di token, sta su una scheda consumer che la maggior parte dei team di produzione non userebbe. Il prezzo mediano di output di AICostBudget, 6 dollari per milione di token, riflette i listini, non le tariffe in cache o batch che i grandi carichi di lavoro pagano davvero.
La lettura pratica: le tariffe orarie per GPU sono ormai un confronto tra commodity, e la differenza si è spostata sul throughput per dollaro, sul comportamento della cache e sull'energia. Gli autori di Quail dicono chiaramente che questo è un inizio, non un traguardo. Chiedono l'unica cosa che il loro benchmark non può fornire da solo, cioè carichi di lavoro reali da team che usano AI-SQL su larga scala.
Fonti
7- 01Quail: Speeding up AI-SQL by jointly optimizing query planner and inference engineEN
- 02Building an Ultra-High Throughput AI-SQL EngineEN
- 03Cloud GPU Pricing — Cost Intelligence for H100, A100 & B200EN
- 04Cloud GPU prices for LLM inference — cost per million tokensEN
- 05AI API Pricing Index — September 2026EN
- 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 07Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.