Il motore di inferenza Quail supera il miliardo di token al minuto mentre i prezzi dei fornitori salgono
Quail, un motore di inferenza sviluppato dal Full Stack Data Lab, ha elaborato più di un miliardo di token al minuto su una singola GPU H100. I risultati sono stati pubblicati il 30 settembre: oltre 10 volte più veloce della baseline vLLM sullo stesso hardware e a meno di 6 centesimi per miliardo di token su Modal.

Questi numeri arrivano mentre la capacità GPU diventa più cara. Secondo diverse indiscrezioni AWS avrebbe segnalato un aumento del 15% dei prezzi della capacità GPU a partire dal 7 ottobre, e Nebius ha alzato i prezzi di inferenza del 18,3% a fine settembre. In questo quadro, questa settimana una serie di progetti sul livello di inferenza ha pubblicato benchmark che attaccano il costo dal lato software.
Quail, abbreviazione di QUery-Aware Inference Layer, nasce dal Full Stack Data Lab. Il team lo descrive come un'ottimizzazione congiunta del pianificatore di query SQL e del motore di inferenza, pensata per AI-SQL: SQL esteso con funzioni definite dall'utente che chiamano un LLM. La relazione di benchmark del motore riporta prestazioni 1,84 volte più veloci di vLLM come media geometrica sulle attività. Tra queste ci sono due query che gli autori hanno progettato per mostrare dove l'inferenza AI-SQL ha ancora bisogno di lavoro.
Il carico di lavoro non assomiglia per niente a quello di un chatbot.
Una funzione AI valuta il proprio prompt riga per riga, quindi una singola query SQL può generare centinaia di migliaia o milioni di chiamate al modello. Lo spiega il post tecnico del laboratorio, pubblicato il 30 settembre. Un filtro richiede una chiamata LLM per riga; un join ingenuo richiede una chiamata per ogni coppia di righe tra due tabelle di input. Inviare queste chiamate come richieste separate a un motore generico come vLLM comporta un forte sovraccarico, sostiene il post, perché le richieste condividono prefissi che potrebbero essere riutilizzati.
La query BIO-4 del laboratorio nel suo benchmark QUAIL-B illustra la scala: 5.000 referti medici lunghi messi in join con 4.144 termini di reazione, con la lista delle reazioni usata due volte per due join. Il piano filtra gli insiemi di termini per reazioni cardiovascolari e neurologiche, poi mette in join i referti sopravvissuti con ciascuno dei due. Eseguirlo in modo ingenuo significherebbe un prompt per ogni input del filtro e un prompt per ogni coppia candidata referto-reazione.
La risposta di Quail è rendere il pianificatore e il motore consapevoli l'uno dell'altro. Quail è pubblicato come versione 0.1.0, con un esempio che esegue una query sul dataset IMDB usando qwen3-4b-fp8 su un dispositivo h100-sxm. La relazione di benchmark del motore riporta il dato del miliardo di token al minuto su una query con più join, dove la pianificazione conta di più, oltre 10 volte più veloce della baseline vLLM su hardware identico.
Modal, che ospita la demo, indica un costo inferiore a 6 centesimi per miliardo di token. Il dato vale per un profilo di query specifico: modelli piccoli a pesi aperti che gestiscono decisioni brevi e delimitate, non lunghe catene agentiche. Gli autori del laboratorio citano DocETL di UC Berkeley, LOTUS di Stanford, Palimpzest del MIT e ThalamusDB di Cornell tra i sistemi accademici dello stesso campo. Attribuiscono poi a tecniche come MOAR, Task Cascades, Abacus e BARGAIN il merito di aver ridotto il numero di chiamate e le dimensioni dei modelli.
La loro tesi è che anche dopo queste ottimizzazioni un piano può ancora richiedere centinaia di migliaia o milioni di chiamate, ed è qui che un motore costruito apposta si guadagna il suo posto.
Quail non è l'unico a puntare sull'hardware locale. Magnitude, azienda di YC S25, ha lanciato il 30 settembre un motore di inferenza open source per agenti, pubblicandolo su GitHub con licenza Apache 2.0. Il suo README sostiene che i modelli aperti girano fino a 2 volte più veloci di llama.cpp, con una scomposizione in 92% più veloce in decodifica su Metal e 19% su CUDA. Il meccanismo è la compilazione e la messa a punto dei kernel sul dispositivo dell'utente prima che un modello venga eseguito, invece di distribuire kernel precompilati per grandi classi di hardware.
Magnitude sostiene anche il 27% in meno di memoria per agente, liberata quando gli agenti si fermano, e la condivisione della cache dei prefissi tra sessioni concorrenti. Supporta Apple Silicon, NVIDIA, AMD o solo CPU. Si collega a Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi e Cline, con un'API compatibile OpenAI per tutto il resto. L'azienda dice che prompt, file e modelli restano sulla macchina, senza bisogno di internet una volta scaricato un modello.
Entrambi i progetti vendono la stessa economia: spostare l'inferenza fuori dagli endpoint cloud a consumo e su hardware che l'acquirente già possiede o affitta a tariffa fissa. I dati sui prezzi suggeriscono perché questa proposta stia funzionando.
L'indice dei prezzi di settembre di AICostBudget, congelato al 30 settembre, copre 81 record pubblici di 11 fornitori. Il prezzo mediano di input su 69 valori scalari non nulli è 1,32 dollari per milione di token; il prezzo mediano di output è 6. L'output mediano è 5,0 volte l'input. Gli intervalli osservati sono ampi: l'input va da 0,10 a 30 dollari per milione di token, l'output da 0,10 a 180.
L'indice quantifica anche le strutture di sconto che rendono fuorvianti le tariffe di listino. Su 58 record comparabili, lo sconto mediano sull'input in cache è del 90%, con un intervallo osservato dal 75% al 98%. Su 44 record che supportano il batch, lo sconto mediano sull'input in batch è del 50%, con intervallo osservato dal 20% al 50%. La conclusione del report è netta: un confronto tra carichi di lavoro che ignora i prezzi di cache e batch omette modalità di risparmio pubblicate per buona parte dei record monitorati.
Le mediane per fornitore nello stesso dataset collocano OpenAI a 2 dollari di input e 11 di output su 18 record, Google Gemini a 0,75 e 4,125 su 14, Anthropic a 5 e 25 su 13, xAI a 1,25 e 2,5 su nove, Mistral AI a 0,20 e 0,60 su sette, DeepSeek a 0,30 e 1,2 su tre, Moonshot AI a 0,95 e 4 su tre, e Cohere a 1,5 e 5,75 su due. Il report avverte che pagine di documento, storage, durata della sessione e altre unità basate sul tempo non possono essere appiattite in una tabella di soli token, e che 13 record contengono componenti non legati ai token.
Non ogni problema di costo è un problema di prezzo. Un articolo presentato a SOSP '26 il 28 settembre sostiene che ottimizzare i cluster GPU solo per l'utilizzo può far salire il consumo energetico. Gli autori, Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma e Neeraja J. Yadwadkar, presentano EnerTune. Il sistema usa modelli analitici delle prestazioni e della potenza per modello, più il consumo dei modelli colocati su GPU condivise, dentro un algoritmo di bin-packing attento all'energia che sceglie insieme collocazione e configurazione.
L'abstract riporta riduzioni di energia da 1,4 a 2,3 volte e riduzioni di potenza da 1,3 a 2,6 volte rispetto alle baseline allo stato dell'arte, rispettando gli SLO di prestazioni. L'articolo sostiene che profilare ogni modello su centinaia di configurazioni costa troppo su larga scala, ed è per questo che l'approccio si basa su modelli invece che su misurazioni.
Nella robotica fisica il vincolo è la latenza, non il throughput. MindOn ha pubblicato Mind-1 il 30 settembre, sostenendo di ridurre la latenza di inferenza dei robot da 82ms a 32ms. Il post dell'azienda osserva che a una velocità dell'end-effector di 3 m/s, 10ms di latenza corrispondono a circa 3cm di movimento, abbastanza per influire su presa precisa, inserimento o manipolazione ricca di contatti. MindOn indica anche il ritmo dei dati di addestramento: gran parte dei dati di manipolazione viene dalla teleoperazione, più lenta del movimento umano naturale, e i modelli imparano il ritmo insieme al compito.
La stessa logica di efficienza compare fuori dall'AI. CleanTechnica ha riportato il 29 settembre che un'analisi di Transport & Environment stima i costi di esercizio delle auto elettriche a meno della metà di quelli del diesel per chilometro. La stima si basa su un consumo diesel di 6,9 L/100 km contro 20,2 kWh/100 km per l'elettrico e un prezzo dell'elettricità di 0,343 €/kWh. Antony Froggatt di T&E ha detto che l'UE dovrebbe tassare i profitti del petrolio per finanziare sostegni alle famiglie a basso reddito e schemi di rottamazione. La stima di T&E sulla ricarica è descritta nella sua stessa metodologia come probabilmente un limite superiore.
Gli operatori delle telecomunicazioni seguono lo stesso copione attraverso il consolidamento. Light Reading ha riportato il 30 settembre che StarHub e M1 sono in trattative di fusione a Singapore, dove le due società condividono già lo spettro 5G e la rete di accesso radio tramite una joint venture chiamata Antina. A giugno Singtel avrebbe detenuto una quota mobile del 43%, con M1 al 22%, StarHub al 21% e Simba al 14%. In Nuova Zelanda, 2degrees e OneNZ hanno proposto di unire le loro reti radio in un'entità a proprietà congiunta, con una decisione della Commerce Commission attesa l'anno prossimo. Light Reading cita l'accordo 5G tra China Telecom e China Unicom come il più grande partenariato del genere, con 1,5 milioni di stazioni base e risparmi di capex dichiarati per 56 miliardi di dollari.
Non è ancora stabilito se il throughput di Quail si tradurrà in bollette più basse per gli utenti ordinari di AI-SQL. Il dato di un miliardo di token al minuto viene da una sola query con più join, scelta perché la pianificazione conta di più, e il benchmark mediato del motore sull'intero set di attività è 1,84 volte, non 10. Il laboratorio stesso ha incluso due query progettate per esporre le debolezze attuali. Quail è alla versione 0.1.0.
Fonti
9- 01Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 02Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 03AI API pricing index - September 2026EN
- 04Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 06Mind-1: Cutting robot inference latency from 82ms to 32msEN
- 07The pricing calculator made people more confused about pricingEN
- 08Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
- 09Singapore, New Zealand operators seek partnerships to cut costsEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.