Quail dichiara 1B token al minuto su una singola H100, mentre i costi di inferenza si dividono
Due nuovi motori di inferenza dichiarano guadagni di efficienza di un ordine di grandezza sullo stesso hardware GPU. Intanto il nuovo abbonamento da 500 dollari di OpenAI e un'istantanea dei prezzi di settembre mostrano che il mercato per token continua a muoversi in direzioni opposte.

Il 30 settembre il Full Stack Data Lab ha pubblicato un post su Quail, un motore di inferenza costruito appositamente per AI-SQL, le estensioni SQL che permettono alle query di chiamare modelli linguistici di grandi dimensioni riga per riga. Il progetto dichiara più di 1B token elaborati al minuto su una singola GPU H100 in una query con più join. Dichiara anche uno speedup geometrico medio di 1,84x rispetto a vLLM su un nuovo benchmark di carichi di lavoro AI-SQL.
Questo è il numero di punta. Ed è anche un numero ristretto.
Il dato di 1B token al minuto viene da un'unica query, che il team descrive come un caso in cui "la pianificazione è particolarmente importante", non da una media. Il numero più ampio del benchmark, 1,84x, è quello che gli autori presentano come risultato generale. Lo stesso giorno Magnitude, azienda di Y Combinator S25, ha lanciato un motore di inferenza open source che, secondo l'azienda, ottimizza i propri kernel sull'hardware dell'utente prima che un modello venga eseguito. Il suo README su GitHub dichiara fino a 2x più veloce di llama.cpp, con il 92% in più di velocità in decodifica su Apple Metal e il 19% su CUDA, e il 27% in meno di memoria per agente. Il progetto è distribuito con licenza Apache 2.0 e gira su Apple Silicon, NVIDIA, AMD o solo CPU.
Cosa confrontano davvero i numeri
Nessuna delle due dichiarazioni è un'affermazione generale sul prezzo dell'inferenza. Magnitude si misura contro llama.cpp, un motore generico, e attribuisce il proprio vantaggio a kernel scritti a mano per le famiglie di modelli open weight più diffuse. Quail si misura contro vLLM e attribuisce il proprio vantaggio all'ottimizzazione congiunta del piano di query SQL e del motore di inferenza. Così milioni di chiamate correlate al modello condividono le cache di prefisso invece di arrivare come richieste separate.
Il post del Full Stack Data Lab, datato 24 settembre, espone direttamente il problema dei costi: una funzione AI in una query SQL valuta il proprio prompt riga per riga. Un filtro richiede quindi una chiamata al modello per riga, e un join ingenuo richiede una chiamata per ogni coppia di righe nei suoi due input.
La query di benchmark del team, BIO-4, gira su 5.000 referti medici lunghi uniti a 4.144 termini di reazione. Gli autori dicono che inviare quelle chiamate a un motore generico come richieste separate comporta un costo elevato. La loro soluzione è pianificare a livello di query. Il blog di Modal sullo stesso lavoro mette l'economia in termini più brutali: meno di 6 centesimi per miliardo di token sull'hardware Modal per la query da 1B token al minuto. Quella cifra è un numero del fornitore per la propria piattaforma, e copre una sola forma di query, non un carico di lavoro rappresentativo.
Applicazioni di inferenza diverse producono carichi di lavoro di inferenza diversi, e AI-SQL non fa eccezione. Una query come quella sopra può produrre milioni di sequenze da migliaia di token.
Il prezzo degli abbonamenti va nella direzione opposta
Sul fronte consumer, OpenAI è andata nella direzione opposta. Al DevDay di martedì l'azienda ha annunciato un livello Pro 500 a 500 dollari al mese, 300 dollari in più rispetto al suo precedente piano top, secondo Business Insider. Il livello include l'accesso al calcolo "Ultrafast" per GPT-6 Astra in ChatGPT Work e Codex, che secondo OpenAI è un aumento di velocità di 8x in Codex, e il massimo utilizzo incluso dall'azienda.
OpenAI ha anche riaperto il suo piano Pro da 200 dollari, ma ha dimezzato la quota di calcolo.
La quota ora è 10x il piano Plus da 20 dollari, in calo rispetto al multiplo di 20x, e i messaggi chat di GPT-6 Pro scendono da 200 a 100 a settimana. Thibault Sottiaux, responsabile dell'ingegneria di Codex, ha scritto in un post su X di lunedì che i cambiamenti si traducono in metà della spesa in dollari in API rispetto al piano precedente. "Volevo assicurarmi di condividere questo cambiamento in anticipo, così potete capirlo prima che vi inondiamo di buone notizie", ha scritto, come citato da Business Insider. Le due mosse puntano in direzioni opposte: una quota più economica per token al livello da 200 dollari, un livello molto più costoso in cima. Gli attuali abbonati Pro ricevono un credito una tantum durante la transizione.
Un'istantanea separata pubblicata il 30 settembre da AICostBudget copre 81 record di prezzi pubblici su 11 fornitori e colloca l'input mediano a 1,32 dollari e l'output mediano a 6 dollari per milione di token. L'intervallo osservato su 69 record con un valore scalare di input va da 0,10 a 30 dollari, e da 0,10 a 180 dollari per l'output. L'output è comunemente la componente più alta del prezzo di listino, con un rapporto mediano output-input di 5,0x.
Lo stesso dataset riporta uno sconto mediano del 90% sull'input in cache su 58 record comparabili e uno sconto mediano del 50% sull'input Batch su 44. Questa è la parte del mercato in cui il prezzo effettivo può divergere nettamente dal prezzo di listino. Ed è anche la parte che un confronto di costi ingenuo di solito manca.
Hardware, energia e il resto dello stack
Il lavoro sull'efficienza non riguarda solo i token al secondo. Un articolo presentato a SOSP '26 il 28 settembre descrive EnerTune, un sistema di serving che modella il consumo energetico per modello e quello dei modelli colocati su GPU condivise. Poi usa un algoritmo di bin-packing attento all'energia per posizionarli e configurarli. Gli autori riportano un consumo energetico da 1,4x a 2,3x inferiore e un assorbimento di potenza da 1,3x a 2,6x inferiore rispetto alle baseline allo stato dell'arte, rispettando al contempo gli SLO di prestazioni. La loro tesi è che ottimizzare puramente l'utilizzo può far salire il consumo energetico, il che conta quando la bolletta non è solo per token.
Sul fronte robotica, MindOn ha presentato Mind-1 il 30 settembre, un modello di AI fisica che secondo l'azienda riduce la latenza di inferenza dei robot da 82ms a 32ms.
L'azienda osserva che a una velocità dell'end-effector di 3 m/s, 10ms di latenza corrispondono a circa 3cm di movimento, abbastanza da influire su una presa precisa. È un mercato diverso da quello dell'inferenza nei data center, ma il vincolo è lo stesso: latenza e costo sono determinati dall'intera pipeline, non dal solo modello.
Gli operatori di telecomunicazioni seguono una logica simile sui costi di infrastruttura. Light Reading ha riportato il 30 settembre che StarHub e M1 sono in trattative di fusione a Singapore, dove già condividono lo spettro 5G e la rete di accesso radio attraverso una joint company chiamata Antina. In Nuova Zelanda, 2degrees e OneNZ hanno proposto di mettere in comune le loro reti radio in un'entità a proprietà congiunta. L'articolo cita la quota del 43% di Singtel nel mercato mobile di Singapore a giugno, contro il 22% di M1, il 21% di StarHub e il 14% di Simba, e dice che una StarHub-M1 combinata sarebbe su una scala simile a Singtel. L'accordo 5G tra China Telecom e China Unicom è citato come il più grande di questo tipo, con 1.500.000 stazioni base coperte e risparmi dichiarati di 56.000.000.000 dollari in capex.
Non ogni tentativo di ridurre i costi aggiungendo macchinari funziona. Un post pubblicato il 30 settembre da Gokul Kogan descrive come Pinecone ha rimosso un calcolatore di prezzi basato sull'utilizzo dopo un test A/B. I visitatori che non vedevano il calcolatore avevano il 16% in più di probabilità di registrarsi e il 90% in più di contattare l'azienda, senza un aumento dei ticket di supporto sui prezzi, secondo il post. In un sondaggio interno, sette dipendenti su dieci si aspettavano che la versione con il calcolatore andasse meglio. La lezione è un avvertimento per chi costruisce uno stimatore di costi per un servizio con prezzo per token: una stima sbagliata di un ordine di grandezza può far perdere del tutto il cliente.
Messi insieme, il quadro è meno un singolo prezzo in calo e più un insieme di scommesse ingegneristiche. Quail punta sul batching consapevole della query. Magnitude punta sulla compilazione dei kernel per dispositivo. EnerTune punta sul posizionamento attento all'energia. OpenAI sta testando quanto un piccolo numero di utenti pesanti sia disposto a pagare per la velocità, mentre il suo livello più economico ottiene meno calcolo di prima. L'unico numero stabile in tutto il dossier è la forma della bolletta: i token di output costano più di quelli di input, gli sconti su cache e batch sono grandi, e le cifre di punta di qualsiasi singolo benchmark descrivono una query, su una macchina, in un giorno.
Fonti
10- 01Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 02Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 03Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 04ChatGPT's new plan costs $500 a monthEN
- 05AI API pricing index - September 2026EN
- 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 07Mind-1: Cutting robot inference latency from 82ms to 32msEN
- 08Singapore, New Zealand operators seek partnerships to cut costsEN
- 09The pricing calculator made people more confused about pricingEN
- 10Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.