Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Quail esegue AI-SQL a un miliardo di token al minuto su una H100 e batte vLLM di 10 volte

Modal e il Full Stack Data Lab della Carnegie Mellon hanno pubblicato il 30 settembre Quail, un motore di inferenza che ottimizza insieme la pianificazione delle query SQL e l'esecuzione del modello. Su una singola H100 supera il miliardo di token al minuto, oltre 10 volte una baseline vLLM.

IA e modelliAnalisiGiulia FerrariPubblicato: 30 settembre 20263 min di letturaFonti 7
Quail esegue AI-SQL a un miliardo di token al minuto su una H100 e batte vLLM di 10 volte

I numeri sono il punto. Su una query con più join, Quail elabora oltre un miliardo di token al minuto per GPU H100, secondo Modal, che ha costruito il motore insieme al Full Stack Data Lab della Carnegie Mellon University. Sull'hardware di Modal il conto scende sotto i 6 centesimi per miliardo di token. Su un nuovo benchmark per query AI-SQL, Quail va 1,84 volte più veloce di vLLM, con media geometrica sulle attività.

Il post di accompagnamento del Full Stack Data Lab, pubblicato lo stesso giorno, spiega dove sbaglia la baseline. Il team ha eseguito vLLM 0.26.0 con Qwen3 4B FP8 su una H100 contro BIO-4, una query che filtra 5.000 referti medici contro 4.144 termini di reazione, con due join. La loro stima di velocità limite per il piano era di 894,37 secondi, cioè 14,91 minuti. vLLM ha impiegato 6,84 ore, 27,55 volte quella stima.

Le cause sono due. C'è l'overhead dell'host: la CPU pianifica e traccia le richieste mentre la H100 resta inattiva. Poi c'è il KV regret: vLLM scarta la cache key-value che gli servirà di nuovo più tardi, così con fattore di scala 1,0 l'esecuzione ha processato 174,6 milioni di token di prefill sprecato.

La soluzione di Quail è strutturale. Con un piano di query in mano, il motore può ordinare ed espellere la cache KV in modo deliberato, una revisione dell'attenzione a cascata in stile Hydragen, e può raggruppare le richieste piccole per tenere occupata la GPU. Modal descrive il risultato come il punto in cui pianificazione del database e scheduling dell'inferenza smettono di essere problemi separati.

Perché conta per il conto

AI-SQL è il pattern in cui SQL viene esteso con funzioni definite dall'utente che chiamano un LLM. Snowflake Cortex AISQL, le funzioni AI di BigQuery, Databricks AI Functions e, di recente, MotherDuck lo supportano, nota il Full Stack Data Lab. Un filtro significa una chiamata al modello per riga. Un join ingenuo significa una chiamata per ogni coppia di righe. Una sola query può generare centinaia di migliaia o milioni di chiamate.

Su questo sfondo, il quadro generale dei prezzi sta diventando più confuso, non più chiaro. L'indice dei prezzi di settembre di AICostBudget, congelato al cutoff del 2026-09-30 UTC, copre 81 record pubblici su 11 fornitori. Il prezzo mediano di input è 1,32 dollari per milione di token; quello di output è 6 dollari. Lo sconto mediano sull'input in cache è del 90%, quello mediano sul batch è del 50%. La stessa pagina avverte che i prezzi di listino sono input per la pianificazione, non fatture.

Le tariffe orarie lorde delle GPU raccontano una divergenza simile. GPUAdvisor, che segue 14 fornitori, con ultimo rilevamento il 1 ottobre, elenca una A4000 16GB su Hyperstack a 0,15 dollari l'ora, una RTX 3090 su Lium a 0,22, e una L40S su Lium a 0,38, che segnala come 89% sotto AWS. Il riepilogo del sito è diretto: i cloud specializzati in GPU offrono prezzi per GPU da 2 a 4 volte più bassi degli hyperscaler, e lo spot può far risparmiare dal 60 al 70% sui run di training con checkpointing.

FitMyLLM converte le tariffe orarie in costo per milione di token, e la classifica si ribalta. La sua opzione misurata più economica è una RTX 3060 12GB su Vast.ai a 0,261 dollari per milione di token. Una RTX 5090 su Vast.ai è la scheda misurata più veloce a 227 token al secondo ma costa 0,576 dollari per milione. Le schede da datacenter si piazzano male in questa vista a singolo stream, e FitMyLLM lo dice: una H100 giustifica il prezzo servendo molti stream insieme, e con un solo stream la sua banda resta in gran parte inutilizzata.

La questione dell'efficienza sotto

L'energia è il prossimo asse. Un articolo presentato a SOSP '26 il 28 settembre, di Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma e Neeraja J. Yadwadkar, sostiene che ottimizzare solo l'utilizzo della GPU può far salire i consumi. Il loro sistema, EnerTune, dichiara da 1,4 a 2,3 volte meno energia e da 1,3 a 2,6 volte meno potenza assorbita rispetto alle baseline allo stato dell'arte, rispettando gli SLO di prestazioni.

Non tutti i fornitori inseguono la stessa curva. Mind-1 di MindOn, annunciato il 30 settembre, punta sulla latenza di inferenza per i robot, tagliandola da 82ms a 32ms, un angolo diverso dello stesso problema: cosa compra davvero un'ora di calcolo.

Commenti 0

Fonti

7
  1. 01Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  2. 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  3. 03AI API pricing index - September 2026EN
  4. 04Cloud GPU Pricing - Cost Intelligence for H100, A100 & B200EN
  5. 05Cloud GPU prices for LLM inference - cost per million tokensEN
  6. 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  7. 07Mind-1: Cutting robot inference latency from 82ms to 32msEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.