Il motore di inferenza Quail supera il miliardo di token al minuto su una H100
Due team di ricerca hanno pubblicato il 30 settembre nuovi risultati sui motori di inferenza. Secondo loro le query AI-SQL possono girare oltre dieci volte più veloci di una baseline vLLM sullo stesso hardware.

Il 30 settembre Modal e il Full Stack Data Lab della Carnegie Mellon University hanno pubblicato i risultati di Quail, uno strato di inferenza consapevole della query. Secondo i due team supera il miliardo di token elaborati al minuto per GPU H100 su una query con più join, oltre 10 volte più veloce della loro baseline vLLM sullo stesso hardware. Alla rivendicazione è associato un dato di costo: meno di 6 centesimi per miliardo di token su Modal.
Il lavoro riguarda AI-SQL, l'estensione di SQL che permette a una query di chiamare un modello linguistico riga per riga. Il blog del Full Stack Data Lab descrive un filtro che richiede una chiamata al modello per ogni riga e un join naivo che ne richiede una per ogni coppia di righe delle due tabelle di input. Questa aritmetica cresce in fretta. In una query di benchmark che il laboratorio chiama BIO-4, 5.000 referti medici vengono uniti a 4.144 termini di reazione, con la lista delle reazioni usata due volte. Il laboratorio scrive che una baseline vLLM 0.26.0 con Qwen3 4B FP8 su una H100 ha impiegato 6,84 ore a fattore di scala 1.0. Il calcolo del laboratorio la rapporta a 27,55 volte una stima ottimistica di roofline pari a 14,91 minuti.
Il laboratorio attribuisce il divario a due cose.
La prima è l'overhead dell'host: la CPU passa lunghi tratti a pianificare le richieste mentre la GPU aspetta. La seconda la chiama KV regret: vLLM scarta stato di chiavi e valori che gli servirà di nuovo più tardi, così l'esecuzione di BIO-4 elabora 174.600.000 token che non era necessario elaborare.
"Il grande vantaggio è che, con in mano una query strutturata, puoi ordinare le richieste per gestire meglio la cache (e l'eliminazione) del KV", afferma il blog di Modal.
Quail non è solo su questa strada. Magnitude, una società di Y Combinator S25, ha aperto il suo repository su GitHub il 30 settembre con una proposta diversa: un motore di inferenza open source per agenti che compila e ottimizza i kernel sul dispositivo dell'utente. Il suo README sostiene che i modelli aperti girano fino a 2 volte più veloci di llama.cpp, con il 92% in più sulla decodifica su Metal e il 19% su CUDA, e il 27% in meno di memoria per agente. Elenca Apple Silicon, NVIDIA, AMD e CPU comuni come target, e distribuisce sotto Apache 2.0. Entrambi i progetti sostengono che lo stack di serving general-purpose lascia prestazioni sul tavolo. La risposta di Quail è conoscere in anticipo la struttura della query. La risposta di Magnitude è conoscere il silicio.
L'economia dietro quell'argomento si vede nei dati sui prezzi. L'indice di settembre di AICostBudget, congelato al taglio UTC del 30 settembre, copre 81 record di prezzi pubblici su 11 fornitori. Su 69 record con uno scalare corrente per i token di input, i prezzi vanno da 0,10 a 30 dollari per 1M di token. L'output va da 0,10 a 180 dollari. La mediana del rapporto output-input sui 69 record che riportano entrambi gli scalari è 5,0 volte. Gli sconti contano quanto i prezzi di listino. Su 58 record comparabili, l'indice riporta una mediana di sconto del 90% sull'input in cache. Su 44 record compatibili con il batch, la mediana dello sconto sull'input in batch è del 50%. La pagina di metodologia è esplicita: i prezzi regionali e le tariffe negoziate non sono catturati, e questi sono input di pianificazione, non fatture.
La ricerca sul lato hardware va nella stessa direzione. Un articolo pubblicato a SOSP '26 il 28 settembre presenta EnerTune, un sistema di serving che usa modelli analitici delle prestazioni e della potenza per modello, più il consumo dei modelli colocati su GPU condivise, per guidare un algoritmo di bin-packing attento all'energia. Gli autori, Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma e Neeraja J. Yadwadkar, riportano riduzioni di energia da 1,4 a 2,3 volte e riduzioni di potenza da 1,3 a 2,6 volte rispetto alle baseline allo stato dell'arte, rispettando gli SLO di prestazioni.
Il loro punto di partenza è che i cluster di GPU restano largamente sottoutilizzati, e che ottimizzare solo l'utilizzo può far salire il consumo energetico. Su larga scala, sostengono, profilare ogni modello su centinaia di configurazioni è proibitivamente costoso, quindi la stima deve sostituire la misurazione.
Non tutti i risultati recenti riguardano lo stack di serving. MindOn ha presentato Mind-1 il 30 settembre, un modello di AI fisica che, secondo l'azienda, taglia la latenza di inferenza dei robot da 82 ms a 32 ms, portando i compiti di manipolazione a tempi di ciclo umani. Il post dell'azienda osserva che a una velocità dell'end-effector di 3 m/s, 10 ms di latenza equivalgono a circa 3 cm di movimento, abbastanza da influire sulla presa e sull'inserimento di precisione. È lo stesso argomento sul budget di latenza, applicato a un braccio robotico invece che a un data warehouse.
C'è un contrappeso da notare. Un post di Gleb Kogan pubblicato il 30 settembre descrive Pinecone che rimuove un calcolatore di prezzi basato sull'uso dalla sua pagina dei prezzi. In un test A/B, i visitatori che non vedevano il calcolatore avevano il 16% in più di probabilità di registrarsi e il 90% in più di contattare l'azienda, senza aumento dei ticket di supporto sui prezzi. Il sondaggio interno prima del test aveva rilevato che 7 dipendenti su 10 si aspettavano che vincesse la versione con il calcolatore. Gli strumenti di costo, in altre parole, possono fuorviare tanto quanto informare, il che è un avvertimento per chi legge i benchmark per token come se fossero una bolletta.
I numeri di Quail restano ricerca pubblicata da un fornitore, e il dato di 1,84 volte che il team fornisce per il suo benchmark appena rilasciato, con media geometrica sui compiti, è una rivendicazione molto più modesta del titolo sul miliardo di token al minuto. Il benchmark stesso include due query che gli autori dicono di aver progettato per mostrare dove l'inferenza AI-SQL ha ancora bisogno di lavoro.
Fonti
7- 01Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 02Building an Ultra-High Throughput AI-SQL EngineEN
- 03Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 04AI API Pricing Index - September 2026EN
- 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 06Mind-1: Physical AI at Human Speed, Built for Real WorkEN
- 07The pricing calculator made people more confused about pricingEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.