Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Quail dichiara un miliardo di token al minuto su una sola GPU mentre il dibattito sui costi di inferenza si inasprisce

Un gruppo di ricerca sostiene che il suo strato di inferenza query-aware ha elaborato più di un miliardo di token al minuto su una singola GPU Nvidia H100, oltre 10 volte più velocemente di una baseline vLLM. È l'ultimo tentativo di ridurre il costo di esecuzione dei modelli linguistici su larga scala. La dichiarazione è stata pubblicata il 30 settembre, lo stesso giorno in cui OpenAI ha annunciato un livello ChatGPT da 500 dollari al mese e un motore open source ha promesso un'inferenza locale 2 volte più rapida.

IA e modelliSpiegatoChiara RomanoPubblicato: 30 settembre 20265 min di letturaFonti 10
Quail dichiara un miliardo di token al minuto su una sola GPU mentre il dibattito sui costi di inferenza si inasprisce

I numeri arrivano dal Full Stack Data Lab e da Modal, che il 30 settembre hanno pubblicato post separati su un sistema chiamato Quail, abbreviazione di QUery-Aware Inference Layer. Il blog di Modal afferma che su una query multi-join Quail ha superato il miliardo di token elaborati al minuto per GPU H100. Secondo il post, è oltre 10 volte più veloce della sua baseline vLLM sullo stesso hardware. Su Modal, il costo scende sotto i 6 centesimi per miliardo di token.

I due post descrivono lo stesso progetto da angolazioni diverse. Il post del Full Stack Data Lab, datato 24 settembre ma pubblicato sul sito il 30 settembre, spiega il problema. AI-SQL estende SQL con funzioni che chiamano i modelli riga per riga. Un filtro può quindi significare una chiamata al modello per riga, e un join una chiamata per ogni coppia di righe. La query di benchmark del laboratorio, BIO-4 in una suite chiamata QUAIL-B, gira su 5.000 referti medici e 4.144 termini di reazione.

Modelli piccoli, volumi enormi

Il testo di Modal inquadra AI-SQL come un fratello più silenzioso del boom degli agenti e dei chatbot. La sua query di esempio unisce clienti e prodotti con un prompt che chiede se uno potrebbe comprare l'altro. Una query del genere, scrive Modal, può produrre milioni di sequenze di migliaia di token, e quelle sequenze spesso richiedono meno dell'intelligenza di frontiera. I modelli piccoli a pesi aperti possono gestirle. Il collo di bottiglia non è la qualità del modello, secondo Modal. È il costo di consegnare milioni di richieste correlate a un motore costruito per traffico arbitrario controllato dall'utente.

L'approccio di Quail consiste nel pianificare insieme la query SQL e il carico di inferenza invece di trattare il motore come un endpoint generico. Modal afferma che la media geometrica dello speedup rispetto a vLLM sul nuovo benchmark AI-SQL è 1,84 volte. È una cifra molto più piccola del caso da un miliardo di token al minuto. L'azienda precisa che due query del benchmark sono state progettate per mettere in luce aree di miglioramento futuro.

"I see it as a point on the LLM pareto optimal curve in a regime that had a large revealed latent demand (no thinking, single token, low latency acceptable intelligence) that was under-invested into because of a race to higher intelligence."

Modal attribuisce quella citazione a Karpathy, descrivendo il modello Jev di TypeSafe AI. Lo stesso post osserva che molti fornitori di database offrono ormai funzioni AI. L'elenco comprende Snowflake Cortex AISQL, le funzioni AI di BigQuery, Databricks AI Functions e, di recente, MotherDuck.

I sistemi accademici attaccano lo stesso spreco. Il Full Stack Data Lab elenca DocETL di UC Berkeley, LOTUS di Stanford, Palimpzest del MIT e ThalamusDB di Cornell. Cita anche tecniche come MOAR, Task Cascades, Abacus e BARGAIN che riducono il numero di chiamate o scelgono modelli più economici. Anche così, scrive il laboratorio, un piano può ancora richiedere centinaia di migliaia o milioni di chiamate.

Listino prezzi contro struttura dei prezzi

Mentre Quail attacca il costo di una query, un'istantanea indipendente pubblicata il 30 settembre traccia quanto fanno pagare i fornitori. L'AICostBudget AI API Pricing Index copre 81 record pubblici congelati su 11 fornitori con un cutoff al 2026-09-30 UTC. Su 69 record con uno scalare di token in input, l'intervallo osservato va da 0,10 a 30 dollari per milione di token. I prezzi di output vanno da 0,10 a 180 dollari. Il prezzo mediano di input è 1,32 dollari e quello di output è 6 dollari, un rapporto di 5,0 volte.

L'indice fa un'osservazione che conta per chiunque modelli la spesa di inferenza: i prezzi di cache e batch non sono errori di arrotondamento. Su 58 record comparabili, lo sconto mediano sull'input in cache è del 90%. Su 44 record compatibili con il batch lo sconto mediano è del 50%. Un confronto di carichi che ignora entrambi, si legge nel rapporto, omette modalità di risparmio pubblicate per una larga parte dei record monitorati. Le mediane a livello di fornitore nell'istantanea includono OpenAI a 2 dollari in input e 11 in output su 18 record, Google Gemini a 0,75 e 4,125 su 14, e Anthropic a 5 e 25 su 13. Compaiono anche Mistral AI, DeepSeek, Cohere e Moonshot AI.

I prezzi per gli utenti finali si sono mossi nella direzione opposta lo stesso giorno. Business Insider ha riferito che OpenAI ha annunciato un nuovo livello Pro 500 al suo DevDay di martedì, al costo di 500 dollari al mese, un aumento di 300 dollari rispetto al piano top precedente. Include l'accesso al calcolo "Ultrafast" per GPT-6 Astra in ChatGPT Work e Codex e una dichiarazione di velocità 8 volte superiore per Codex. OpenAI ha anche riaperto il suo piano Pro da 200 dollari dimezzando l'assegnazione di calcolo a 10 volte il piano Plus da 20 dollari, in calo rispetto a 20 volte. Ha ridotto i messaggi chat di GPT-6 Pro da 200 a 100 a settimana. Thibault Sottiaux, responsabile engineering di Codex, ha detto in un post su X di lunedì che i cambiamenti si traducono in metà della spesa in dollari in API rispetto al piano precedente.

Sul fronte hardware il quadro è più confuso. Un post di lancio su GitHub di Magnitude, azienda di YC S25, sostiene che il suo motore open source ottimizza i kernel sul dispositivo dell'utente ed esegue modelli aperti fino a 2 volte più velocemente di llama.cpp. Cita un decode più rapido del 92% su Metal e del 19% su CUDA, più il 27% di memoria in meno per agente. Sono benchmark del fornitore, non test indipendenti, e il post non fornisce alcuna verifica di terze parti.

Separatamente, il paper SOSP '26 "Beyond Utilization" di Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma e Neeraja J. Yadwadkar sostiene che ottimizzare i cluster GPU puramente per l'utilizzo può aumentare il consumo energetico. Presenta un sistema chiamato EnerTune che, secondo gli autori, riduce l'energia di 1,4-2,3 volte e la potenza assorbita di 1,3-2,6 volte rispetto alle baseline allo stato dell'arte. Il paper è stato pubblicato il 28 settembre. Il 30 settembre CleanTechnica ha riportato un'analisi di Transport & Environment secondo cui i guidatori di auto elettriche in Europa pagano meno della metà di quanto pagano i guidatori diesel per chilometro, con il diesel a 32 euro in più per pieno rispetto all'inizio dell'anno e circa 16 euro di quel surplus dovuti al margine di raffinazione.

Commenti 0

Fonti

10
  1. 01Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  2. 02Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  3. 03AI API Pricing Index - September 2026EN
  4. 04ChatGPT's new plan costs $500 a monthEN
  5. 05Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  6. 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  7. 07Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
  8. 08Mind-1: Cutting robot inference latency from 82ms to 32msEN
  9. 09The pricing calculator made people more confused about pricingEN
  10. 10Singapore, New Zealand operators seek partnerships to cut costsEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.