Quail e Magnitude attaccano i costi di inferenza dai due estremi dello stack
Due progetti open source pubblicati il 30 settembre rivendicano lo stesso premio partendo da direzioni opposte: Quail dichiara oltre un miliardo di token elaborati al minuto su una singola H100 pianificando query SQL contro il motore di inferenza, mentre Magnitude sostiene di eseguire modelli aperti fino a 2 volte più velocemente di llama.cpp compilando i kernel sull'hardware dell'utente.

La proposta di Modal e del Full Stack Data Lab della Carnegie Mellon University è precisa. Quail, il QUery-Aware Inference Layer, ha superato il miliardo di token elaborati al minuto per GPU H100 su una singola query multi-join, ha scritto il team il 30 settembre, oltre 10 volte più veloce della loro baseline vLLM sullo stesso hardware. Sul cloud di Modal questo equivale a meno di 6 centesimi per miliardo di token.
Il numero è abbastanza grande da sembrare un refuso.
Non è una dichiarazione su un nuovo modello o un nuovo chip. Riguarda l'ordine delle operazioni.
Cosa fa davvero Quail
AI-SQL estende SQL con funzioni che chiamano un modello linguistico per riga. Un filtro richiede una chiamata al modello per riga. Un join ingenuo richiede una chiamata per ogni coppia di righe tra due tabelle. Il blog del Full Stack Data Lab, pubblicato il 24 settembre e ripreso da Modal, analizza una query di benchmark chiamata BIO-4: 5.000 referti medici messi in join con 4.144 termini di reazione, due volte. Il calcolo del laboratorio fissa il limite teorico di quella query a 894 secondi, ovvero 14,91 minuti, ipotizzando il picco di throughput della GPU, la piena sovrapposizione CPU-GPU e spazio illimitato per la KV cache conservata. Eseguire vLLM 0.26.0 con Qwen3 4B FP8 su una H100 ha richiesto 6,84 ore, 27,55 volte quel limite inferiore. Il blog attribuisce il divario a due cose: l'overhead dell'host, dove la CPU pianifica le richieste mentre la H100 resta inattiva, e quello che chiama KV regret, dove vLLM scarta la cache key-value di cui ha bisogno più tardi. Su BIO-4 con scale factor 1.0, il laboratorio afferma che vLLM ha elaborato 174.600.000 token, e la frase si interrompe nel testo che abbiamo.
La soluzione di Quail è usare la struttura della query stessa come segnale di pianificazione. Se il motore conosce il piano, può ordinare le richieste per riutilizzare la cache e rimuoverla deliberatamente, invece che in modo reattivo. Il post di Modal lo descrive come una leggera revisione dell'attenzione a cascata in stile Hydragen, e attribuisce il merito alla collaborazione tra i ricercatori di inferenza di Modal e i ricercatori di database della CMU.
Su un benchmark AI-SQL appena rilasciato, Quail va 1,84 volte più veloce di vLLM come media geometrica sui task, una cifra molto più piccola del titolo sul miliardo di token. Il post di Modal dice che il benchmark include due query progettate per mostrare dove l'inferenza AI-SQL ha ancora bisogno di lavoro. È una divulgazione utile: il numero di 10 volte è un caso migliore su una query, non un'accelerazione generale.
Magnitude va nella direzione opposta
Magnitude, azienda di Y Combinator S25, ha pubblicato il suo repository il 30 settembre con un argomento diverso. Il suo motore di inferenza compila e ottimizza i kernel sul dispositivo reale prima che un modello venga eseguito, invece di distribuire kernel precompilati per ampie classi di hardware. Il README dichiara fino a 2 volte più veloce di llama.cpp, con il 92 per cento in più nella decodifica su Metal e il 19 per cento su CUDA. Dichiara anche il 27 per cento in meno di memoria per agente.
L'hardware supportato è volutamente ampio: Apple Silicon, NVIDIA, AMD o una CPU da sola. Il progetto dice che non c'è un minimo fisso, e che le macchine più piccole eseguono modelli più piccoli. Viene distribuito come app desktop con una CLI, si connette a Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi e Cline, ed espone un'API compatibile con OpenAI per tutto il resto. È sotto licenza Apache 2.0 e funziona in locale.
I due progetti non sono concorrenti. Quail punta al livello SQL analitico, dove un pianificatore di query genera milioni di chiamate piccole e strutturate al modello. Magnitude punta al portatile dello sviluppatore, dove un agente lavora su un modello e il vincolo è la memoria e la velocità di decodifica. Ma indicano lo stesso problema di costo dai due estremi: l'inferenza costa perché i motori general-purpose non sanno cosa farà il carico di lavoro subito dopo.
Cosa dicono i dati sui prezzi
L'indice dei prezzi di settembre di AICostBudget, congelato al 30 settembre UTC su 81 record pubblici di 11 fornitori, offre il contesto di mercato. Su 69 record con uno scalare corrente per i token di input, i prezzi vanno da 0,10 a 30 dollari per 1M di token. I prezzi di output vanno da 0,10 a 180. Il prezzo mediano di input è 1,32, il prezzo mediano di output è 6, e il rapporto mediano output-input è 5,0 volte.
L'indice fa un'osservazione facile da perdere in una classifica del singolo modello più economico. Su 58 record comparabili, lo sconto mediano sull'input in cache è del 90 per cento. Su 44 record compatibili con il batch, lo sconto mediano sul batch è del 50 per cento. Un confronto tra carichi di lavoro che ignora l'una o l'altra modalità confronta prezzi di listino che nessuno paga.
Le mediane per fornitore nell'indice, che la metodologia dichiara non ponderate per utilizzo né per quota di mercato: Google Gemini a 0,75 in input e 4.125 in output su 14 record con prezzo, Mistral AI a 0,20 e 0,60 su 7, DeepSeek a 0,30 e 1,20 su 3, OpenAI a 2 e 11 su 18, xAI a 1,25 e 2,50 su 9, Cohere a 1,50 e 5,75 su 2, Anthropic a 5 e 25 su 13, e Moonshot AI a 0,95 e 4 su 3. AWS, Azure e Google Cloud contribuiscono ciascuno con un record senza valore numerico.
Il fronte hardware
L'efficienza hardware viene attaccata in parallelo. EnerTune, un articolo pubblicato negli atti di SOSP '26 il 28 settembre, sostiene che ottimizzare i cluster GPU solo per l'utilizzo può aumentare il consumo di energia. Gli autori, Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma e Neeraja J. Yadwadkar, propongono modelli analitici per prestazioni e potenza per modello, più il consumo dei modelli colocati su GPU condivise, che alimentano un algoritmo di bin-packing attento all'energia. Dichiarano di rispettare gli SLO di prestazioni riducendo l'energia da 1,4 a 2,3 volte e il consumo da 1,3 a 2,6 volte rispetto alle baseline allo stato dell'arte.
È una leva diversa da quella di Quail, e arriva con la stessa avvertenza: risultati di benchmark, non distribuzioni in produzione. L'articolo nota esplicitamente che profilare ogni modello su centinaia di configurazioni è proibitivamente costoso su larga scala, ed è per questo che usa modelli analitici.
Nel frattempo l'esperienza di Pinecone con il proprio calcolatore di prezzi, descritta da Gkogan il 30 settembre, ricorda che la confusione sui costi non è solo un problema di calcolo. L'azienda ha rimosso il calcolatore dopo che un test A/B ha rilevato che i visitatori che non lo vedevano avevano il 16 per cento in più di probabilità di registrarsi e il 90 per cento in più di contattare, senza un aumento dei ticket di supporto sui prezzi. Sette dipendenti su dieci avevano previsto che avrebbe vinto la versione con il calcolatore.
Il filo comune tra Quail, Magnitude ed EnerTune è che i guadagni maggiori arrivano dal sapere di più sul carico di lavoro, che si tratti di un piano di query, di un chip specifico o di uno schema di colocazione. I motori general-purpose lasciano quell'informazione sul tavolo. Quello che nessuno dei tre stabilisce ancora è se i guadagni sopravvivono al contatto con il traffico di produzione disordinato, e solo Magnitude distribuisce qualcosa che uno sviluppatore può installare oggi.
Fonti
6- 01Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 03Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 04AI API Pricing Index - September 2026EN
- 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 06The pricing calculator made people more confused about pricingEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.